那个保护了日志却让模型泄露输出结果的 PII 脱敏器
仅针对输入的 PII 脱敏器只是半个控制措施。一旦模型具备了生成能力,输出路径就变成了你在审查中从未提及的泄露面。
由于注册表缓存存在一小时延迟,你的智能体仍在调用已被撤销的工具
当用户移除一个智能体工具时,一小时的注册表缓存以及将拒绝视为暂时性错误的重试策略,会将一次常规的撤销变成一个安全事件,而用户只能通过审计日志才发现这一问题。
被反向代理剥离的 SSE Keep-Alive,以及你支付了两次费用的 Prompt
LLM 流式响应看起来像是从模型到用户的通畅管道 —— 直到一次 35 秒的工具调用导致反向代理断开连接,你的客户端针对无状态 API 重试整个 Prompt,最终用户的账单为同一个响应支付了两次费用。
增加更多工具后,你的智能体“不知道”率为何反而下降了
扩大工具覆盖范围在仪表盘上看起来像是能力的提升。但实际上,这往往是计划器在悄悄地将诚实的“不知道”转化为自信的错误答案。
那个‘总结’掉用户原始提问的压缩策略
自动总结保留了对话脉络,但悄然改变了下游工具所依赖的字面表述。本文将探讨该 Bug 是如何出现的,以及如何针对它进行架构设计。
抹除后续问题所需上下文的对话记忆修剪启发法
基于近因和长度的修剪会剔除后续轮次默默依赖的约束,而用户会将言之凿凿的错误回答视为能力退化。修剪是检索的对偶,那些为了 Token 数量而调整修剪策略的团队,正在悄然降低回答质量。
会话摘要抹掉了用户授予你的同意标志
压缩保留了智能体的回答,却遗忘了用户的选择。应将对话记忆视为语义和结构化两个流,否则你交付的将是隐私违规。
你的 Agent 把开发环境当成了生产环境,因为系统提示词从未指明是哪一个
Agent 继承了你的代码逻辑,但没有继承你的空间感。当预发和生产环境的提示词完全相同时,模型会根据训练数据来填充“它在哪里”的信息 —— 而“生产数据库”通常是默认选项。本文将介绍如何让 Agent 感知并锚定其所处的环境。
那个教会用户永远不要打断智能体的中断 UI
流式智能体的停止按钮可能会诱导用户强忍着看完错误的回答,而不是及时纠偏。解决方法是将“中断”视为对话中的一个轮次,而不是 API 调用的断路器。
带有延迟预算的紧急开关:你的故障处理从未达到的标准
如果一个 AI 功能的遏制时间超过了其爆炸时间,那么所谓的紧急开关只是纸上谈兵,而非实际可用。测量激活延迟,根据损失率对其进行分层,并将该数值写入运行手册。
你的编排器在规划步骤上消耗的延迟预算
智能体的大部分延迟都消耗在了决定下一步该做什么,而不是执行上。将规划器的开销视为一等公民的 SLO 指标,优化方向就会变得显而易见。
你的产品视图从未呈现的推理 Token
扩展思维在每次调用中都会生成一个推理产物,你的工程师可以看到,但你的支持、PM 和事故处理团队却看不到。这个断层正是客户投诉集中的地方。