提示词 Diff 隐藏了自身的爆炸半径
一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。
重提率:你的评估流水线从未提取出的失败信号
在会话中重复同一个问题的用户是在告诉你之前的回答失败了——但回合级评估和会话结束时的 CSAT 都会忽略这一点。本文将介绍如何将重提率作为核心指标进行检测。
Shadow Replay 会惩罚那些本可以改变对话走向的模型
Shadow Replay 评估会悄悄地惩罚更好的模型,因为它根据旧模型引导下的用户对话记录来给新模型评分。本文将探讨其中的原因,以及影子回放仍然可以真实衡量哪些指标。
那个把上周 Slack 消息当成昨天消息来读的智能体
一个智能体检索到一条 6 周前写的“我们明天发布”的消息,并将其视为当前的计划。检索流水线保留了正文,却弄丢了时钟。
演示成功是因为有人在看:会话长度是你的评测套件遗漏的那个维度
五轮的演示掩盖了在第二十八轮才会出现的误差累积、注意力漂移和承诺粘性。把会话长度当作一等评测维度来对待,否则你交付的可靠性数字,用户其实已经见过它的另一个版本。
语义过时的 Embedding:当向量不再理解当下
随着现实世界的词汇演变,嵌入式知识库正在悄然失效。召回率仪表板往往会忽略这一点,因为它们仍基于过时的相似性定义进行评分。
填充式工具调用:当智能体在表演勤奋而不是真正干活
生产环境中的智能体不断发出对答案毫无影响的工具调用——烧掉 token、拖慢延迟、损害准确率。本文讲清楚填充式调用是如何从训练中长出来的、它真正的成本是多少,以及如何用反事实测量和调用预算把它从工作流里剔除出去。
聚合指标隐藏的首次用户断崖
AI 功能的聚合指标往往看起来健康,但新用户却在一两次尝试后就流失。本文剖析首次用户断崖如何隐藏在你的指标中,以及消除它的几种模式。
你的智能体没读过的那条休假自动回复
大多数智能体堆栈按姓名而不是按角色呼叫真人 —— 一旦有人休 PTO,智能体就会和自动回复对打,直到值班同事注意到。
你删除的代码对你的编程 Agent 是不可见的
编程 Agent 会重新引入你昨天删除的代码,因为已删除的内容在仓库中没有留痕。这是一份记录 Agent 需要遵守的“否定决策”的实战指南。
那个悄然演变成延迟敏感型服务的夜间批处理作业
随着一个又一个合理需求的加入,一个夜间批处理作业最终演变成了对延迟要求极高的服务。本文将探讨为什么批量推理和在线推理的优化目标截然相反,架构漂移如何导致隐蔽的故障,以及如何有针对性地进行重新架构。
你的智能体没有营业时间的概念
AI 智能体在做出决定后会立即行动,完全不考虑凌晨 3 点是否是不合适的发送时间。本文探讨如何将全天候工作与日间工作区分开来,并构建一个能够识别等待时机的定时层。