并非“全员回复”:智能体出站扇出风险
智能体对“全员回复”没有肌肉记忆。当发送工具的接收方字段无法区分分发列表与个人时,规划器往往会选择动静最大的那扇门。这里有四种将爆炸半径限制在可控范围内的实践。
你的 AI 功能忘记计入的 SIEM 账单
发布 AI 功能会让你的审计日志量增加 10–50 倍。随之而来的 SIEM 续费账单中,包含着失效的检测规则和没人预料到的法律留存问题。
为什么每周会话记录审查优于你的 AI 仪表板
每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。
Brownout 模式:当你的 LLM 供应商响应迟缓而非宕机时
供应商的可用性是连续的,而非二元的。你的回退链条能处理显而易见的宕机,却往往忽略了那些在数小时内悄悄消磨用户信任的 Brownout 现象(响应迟缓)。
评估集腐化:为什么评估分数在上升,而用户满意度在下降
评估分数在攀升,但用户投诉也在同步增长。一个基于发布周流量构建的评估集,在六个月后可能已经悄然失去了衡量产品的能力 —— 本文将介绍如何通过影子集、重采样和切片规则来保持仪表板的真实性。
多步 Agent 的延迟预算:为什么 P50 会说谎,而 P99 才是用户的真实感受
多步 Agent 在中位数延迟上看起来很快,但在尾部延迟上却让人感觉很慢。本文将探讨为什么系统组合会惩罚 P50 仪表板,以及如何设计符合用户实际体验的延迟预算。
智能体事件取证:在需要之前即刻捕获
当智能体误发退款时,你的首席营收官(CRO)会询问原因——而答案需要你在写入时捕获的元组:提示词、模型 ID、解码配置、工具结果以及对话历史。本文介绍了如何通过工程纪律让“我们可以重构现场”成为现实。
你的 Agent 发布说明只是在列出文件,但集成商需要的是行为差异(Behavior Diffs)。
每次 Agent 发布都包含系统提示词、模型、工具、评分标准和检索器的变更集合——而基于文件差异的变更日志无法告诉集成商任何关于行为转变的信息,而这些转变才是他们真正需要解析、制定预算或导致系统报警的关键。
Agent 追踪采样:当 “记录所有内容” 耗费 8 万美元却依然漏掉性能退化时
请求级的采样策略对 Agent 追踪已不再适用。采用分层策略——始终追踪失败、对成功请求进行头部采样、按成本百分位进行尾部采样——能将追踪存储从预算黑洞转变为有效的事件响应工具。
参数幻觉是漂移信号,而非模型 Bug
当模型虚构参数值时,成本最低的假设并不是“模型失败了”,而是“你提供给模型的描述与连接另一端的 API 不再匹配”。
为什么你的偏见评估在 CI 中通过但在部署时失败
静态偏见审计在 CI 中通过但在生产环境中失败,是因为输入分布发生了偏移。解决方案是使用按队列设置的 SLO 和具备漂移感知的发布门控进行持续公平性监控。
评估集也有季节性:为什么质量在报税季的第一个周一会下降
生产流量并非一成不变。在 3 月采样并在 10 月运行的评估集,面对的是从未在黄金数据行中出现过的 “10 月特征” 客户。以下是如何保持质量把关真实性的方法。