采样参数继承:当 0.7 的温度从规划器泄露到验证器时
将温度沿调用树向下传播的智能体框架,会将规划器的创意旋钮变成验证器的 Bug。本文探讨了基于角色的采样配置文件、默认拒绝继承,以及捕获此类泄露的分歧率评估。
Session Stitching:为什么你的会话 ID 是个谎言
框架交付的是会话 ID;而用户生活在任务中。两者之间的鸿沟导致了一半的智能体 UX 体验流失,解决方案是使用任务 ID,而不是延长会话时间。
AI 工程师的三种品味:为什么 Prompt、Eval 和 Guardrail 往往无法共存于一个大脑中
Prompt 品味、Eval 品味和 Guardrail 品味是 AI 工程师这一职位头衔下隐藏的三种截然不同的直觉。如果你将它们视为同一种技能来进行招聘和晋升,你将交付一个失衡的系统——即便所有的指标都显示正常(全绿),用户却在流失。
你的工具目录遵循幂律分布,而你却在针对长尾进行优化
生产环境中的工具使用遵循幂律分布,但大多数 Agent 框架都将工具目录视为扁平结构,并为此付出了代价:Token 膨胀、工具数量超过 100 个时的准确度崩塌,以及隐性的长尾回归。这是一份关于热/冷分区的实战指南。
拒绝还是上报:置信度门控 AI 中的双阈值问题
单个置信度阈值将“拒绝”和“上报”这两个截然不同的决策强行合并为一个数字,而这种妥协正是导致你的信任度指标持续下滑的原因,即便在准确率看起来还不错的情况下也是如此。
Prompt 迭代中的“局部最大值”陷阱:如何判断你调错了地方
提示词调优了六周,评估分数依然在 4 分的区间内波动?你正处于局部最大值。本文将教你如何诊断你究竟撞到了哪块天花板——是提示词、检索、模型、规范还是数据——并选择能打破僵局的关键杠杆。
人格漂移:当你的智能体忘记自己的身份时
长对话会悄悄侵蚀系统提示词。本文探讨了为什么智能体人格会在 8–12 轮对话后发生漂移,如何衡量其半衰期,以及哪些强化模式能够保持稳定性。
你的准确率提升了,但你的校准崩溃了
一个提升了 3 个百分点准确率的提示词重构,可能会悄无声息地破坏用户信任的对冲信号。使用 ECE、可靠性图表和拒绝率来衡量校准,而不仅仅是准确率。
智能体能力悬崖:为什么你的模型升级让简单的 95% 变得完美,却让困难的 5% 成了你最糟糕的季度
模型升级提升了你的整体通过率,但同时也让剩余的失败集中在最困难的 5% 流量中 —— 本文将探讨分层评估和能力边界探测如何在这些问题进入你的值班轮值表之前,揭示这种“能力悬崖”。
你的黄金标签是从你的模型中学到的:通过生产环境泄漏导致的评估集污染
当标签来自生产反馈、查看草稿的人类标注员以及 RLHF 痕迹时,评估集会悄无声息地记住你的模型偏差。本文将探讨防止“镜子”获胜的溯源规范。
“以后再加评估”的陷阱:测量债务如何产生复利效应
跳过评估能让你在一个季度内发布得更快,但接下来的四个季度会变慢。本文探讨了测量债务如何产生复利效应、早期的预警信号,以及防止这种偏移的组织级强制机制。
LLM-as-Judge 漂移:当你的评估器升级导致所有数据变动时
如果回归测试套件在没有任何提示词更改的情况下变红,通常问题出在裁判身上,而不是候选模型。本文探讨评估器漂移如何制造虚假的胜负,为什么固定裁判和校准频率至关重要,以及在评估元数据中应记录哪些内容以防止仪表盘数据误导。