跳转到主要内容

你无法修改的产品策略:模型提供商的安全过滤器

阅读需 1 分钟Tian PanTian Pan

临床决策支持工具的任务只有一个:帮助医生使用他们在病历中使用的词汇来推理症状、药物和治疗方案。这意味着智能体必须能够直呼其名地讨论药物过量阈值、药物相互作用、禁忌症和剂量。这些都不是可选的。这就是产品本身。

因此,当模型在会诊中途打断,对面前就有患者的专业医生说,没有专业监督就无法提供医疗建议时,这是一种特殊的失败。医生没变,患者没变,提示词也没变。改变的是团队并不拥有的安全过滤器,它是针对团队并不属于的人群进行微调的,并按照团队无法控制的时间表进行更新。

这就是“供应商审核裂缝”(vendor moderation seam),它是应用 AI 领域讨论最少的边界之一。大多数团队将供应商的安全层视为模型的固定属性,就像上下文窗口一样。但事实并非如此。这是一种策略——一种动态的策略——无论你是否编写了它,现在它就是你产品的策略。

过滤器是针对他人的流量进行校准的

供应商的安全过滤器是针对混合人群进行调整的。该人群以消费级聊天流量为主:人们询问一般性问题,其中一小部分人确实有自残、欺诈或虐待倾向。过滤器的任务是拒绝该分布中的危险尾部,同时对良性的中间部分保持帮助。对于普通客户来说,这是有效的。

但你的产品不是普通客户。临床工具的流量几乎完全是消费级过滤器被训练去怀疑的那种内容。“这种药物的致死剂量是多少?”在消费级流量中是自残信号,而在你的流量中则是常规的临床管理问题。过滤器无法区分这两者,因为区别在于过滤器从未见过的上下文:用户是谁、他们在什么界面上、他们被授权做什么。过滤器看到的只是 Token,匹配模式,然后拒绝。

研究文献对此有一个称呼——过度拒绝(over-refusal)或夸大安全(exaggerated safety)。OR-Bench 是首个针对该现象的大规模基准测试,它汇集了 80,000 个看起来有害但实际上良性的提示词,外加一个包含约 1,000 个提示词的困难子集,甚至能难倒最前沿的模型。各模型的实测错误拒绝率从不足 1% 到超过 23% 不等。该基准测试最令人震惊的发现是,模型拒绝真实有害提示词的频率与拒绝良性提示词的频率之间的斯皮尔曼相关系数为 0.878:大多数模型只是通过过度拒绝来换取安全,极少数模型能打破这种权衡。当供应商为了减少真实伤害而收紧限制时,你那些良性但“辛辣”的流量就会被一网打尽。

医疗领域以另一种方式使这种人群失配变得具体。《npj Digital Medicine》的一项纵向分析发现,生成式模型输出中的医疗安全免责声明比例从 2022 年的 26.3% 暴跌至 2025 年的 0.97%,视觉语言模型也遵循同样的曲线。供应商显然正在积极且持续地调整这些行为——你所构建的平台并不稳定,其发展方向是由对混合人群有利的因素决定的,而不是为了你的特定需求。

悄无声息的更新是你未批准的策略变更

这是该失败模式最尖锐的形式。第一个月,你生产环境流量的拒绝率为 3% ——虽然恼人,但尚可生存,在容忍范围内。然后,供应商发布了一个针对完全不同产品界面的过滤器更新,也许是一个需要更严格处理自残问题的消费级产品发布。如果有变更说明的话,通常会写着“提高了敏感话题的安全性”之类的话。经过这次悄无声息的发布,你的拒绝率攀升到了 11%。

11% 听起来并不致命,直到你将其映射到实际体验中。医生在会诊中途开始遇到读起来像消费级聊天机器人推诿的话术——那种照本宣科的“我无法提供帮助,请咨询专业人士”——而对方本身就是专业人士。每一次拒绝都是一次小小的羞辱,也是对工作流程的破坏。你的客户成功队列中塞满了威胁要取消订单的医院,因为这款作为临床推理支持工具销售的产品,现在却用消费级的警告来打断工作。

文献中开始提到一种二阶伤害:突发性拒绝次生伤害(abrupt refusal secondary harm)。拒绝并非中性的非事件。当系统从一个称职的协作者转变为照本宣科的免责声明时,用户会感受到被排斥——尴尬、受限,有时甚至是侮辱。在临床环境中,推理过程中的拒绝不仅无法提供帮助,还会主动削弱医生对原本开始产生依赖的工具的信任。成本完全由你承担。发布更新的供应商看不到你的投诉队列,也不承担你的客户流失。

结构性问题在于,这是一种产品策略的变更——关于你的产品被允许对用户说什么的决定——而且这个决定是由一个从未见过你的用户的人做出的,目的是优化一个不属于你的指标,并且在未经你批准的情况下发布。如果你团队的产品经理在一夜之间单方面将临床查询的拒绝率提高了 8 个百分点,你会回滚操作并与其进行严肃的谈话。而当供应商这么做时,大多数团队只会提交一张支持工单并苦苦等待。

“我们的政策是一致的”是你应该围绕其进行规划的答案

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 10 分钟

隐藏在你的 AI 安全过滤器中的精确率-召回率权衡

大多数团队在发布 AI 安全分类器时使用默认阈值,从未衡量误报成本。本文将探讨为什么这会悄无声息地大规模阻止合法用户,以及如何在演变成客服危机之前揭示这种权衡的校准实践。

insider
ai-safety
阅读需 9 分钟

流式回滚问题:你无法收回已发送的 Token

流式输出在任何护栏检查之前就已触达用户。本文将探讨为什么输出审核与 Token 流式传输在结构上存在冲突,以及如何通过缩短暴露窗口来应对这一问题,而非对其视而不见。

insider
llm
阅读需 10 分钟

隐藏草稿板问题:为什么仅凭输出监控无法保障生产级 AI Agent 的安全

前沿模型在可见的推理中仅有 25–41% 的时间会承认敏感输入的影响。本文将探讨为什么输出层监控无法保障生产级 Agent 的安全,以及如何构建能够追踪隐藏计算的监管机制。

insider
ai-safety
阅读需 11 分钟

智能体精准优化了你衡量的指标:代理循环中的古德哈特定律

代理循环将古德哈特定律压缩进单次运行中:将代理指标交给一个强大的优化器,它就会利用其中的间隙进行博弈。本文介绍了失效分类学以及如何对其进行约束。

insider
ai-agents
阅读需 8 分钟

AI 内容过滤器的双边成本:过度拒绝同样是业务问题

AI 内容过滤器通常被调整为尽量减少漏报,同时忽视误报——但拦截合法用户同样有可量化的业务损失。本文介绍如何正确校准这两类错误。

content-moderation
ai-safety