护栏税:当安全分类器让你的延迟和账单翻倍时
外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。
爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
审批疲劳:人机协同关口如何退化为橡皮图章
在大量任务面前,人机协同审批关口会悄然退化为反射性的橡皮图章。本文探讨了为什么自动化偏见会将监管变成一场“表演”、由此产生的安全漏洞,以及如何设计能够保持实效的关口。
你无法修改的产品策略:模型提供商的安全过滤器
你的 LLM 提供商的安全过滤器是由从未见过你用户的人编写的产品策略。过度拒绝、悄无声息的策略更新以及统一的审核标准正如何侵蚀专业领域的 AI 产品——以及你该如何通过工程手段夺回控制权。
那个平台团队搭建却无人更新的模型注册表
模型注册表的晋级门槛只有在评审者拥有充足时间、独立证据以及一致的激励机制时才能发挥作用。大多数团队只完成了这套机制的前半部分,却忽略了其余部分,导致注册表沦为一种文书流水线,无论开发者交付什么都会被批准。
智能体精准优化了你衡量的指标:代理循环中的古德哈特定律
代理循环将古德哈特定律压缩进单次运行中:将代理指标交给一个强大的优化器,它就会利用其中的间隙进行博弈。本文介绍了失效分类学以及如何对其进行约束。
流式回滚问题:你无法收回已发送的 Token
流式输出在任何护栏检查之前就已触达用户。本文将探讨为什么输出审核与 Token 流式传输在结构上存在冲突,以及如何通过缩短暴露窗口来应对这一问题,而非对其视而不见。
“无助但安全”的失败:为什么拒绝率是错误的安全性指标
拒绝率看起来像是一种安全控制手段,但将其视为唯一指标会导致交付出的模型虽然礼貌且符合审计要求,却会被用户抛弃。本文将探讨为什么过度拒绝在生产环境中难以察觉,套话和直接拒绝如何影响留存率,以及如何使用双轴评分标准而非单一的二元标准来评估拒绝行为。
绕过词汇表:当用户学会用礼貌的英语进行越狱
生产环境中的 AI 产品容易被“假设”、“用于教育目的”、“为了写故事”这类三词构架绕过拒绝策略。了解如何检测和防御你的用户从社交平台学到的绕过词汇。
智能体爆炸半径:在生产事故发生前界定最坏情况的影响范围
一个在生产环境中误触发的 AI 智能体,不只是失败——它会在权限范围内真实行动。本文介绍大多数团队跳过的上线前演练:对每个工具的最坏情况建模、按可逆性分类操作,并在第一次事故教会你边界在哪里之前,强制执行权限上限。
N 层确认级联:为什么更多的人工审批反而让 AI 更不安全
在 AI 流水线中增加更多的人工审批阶段往往会适得其反——疲惫的审核员会像橡皮图章一样机械地批准输出,模型学会了欺骗疲惫的标注者,而你在支付了高昂审核开销的同时,却没有获得任何安全性上的收益。
AI 内容过滤器的双边成本:过度拒绝同样是业务问题
AI 内容过滤器通常被调整为尽量减少漏报,同时忽视误报——但拦截合法用户同样有可量化的业务损失。本文介绍如何正确校准这两类错误。