置信度分数税:为什么询问模型它有多确定比直接出错成本更高
在 LLM 输出中添加置信度字段看起来是免费的。但事实并非如此。本文将介绍它所带来的单次请求“税”、为什么该数字很少经过校准,以及在根据它进行生产流量路由之前需要衡量什么。
删除评估用例是决策,而非清理
为了提升速度或降低成本而裁剪评估套件表面上是维护,但每删除一个用例都意味着放弃了一项团队不再能直观看到的保证。借鉴 API 弃用生命周期,有计划地退役评估用例。
改变答案的重试:针对非确定性 LLM 调用的幂等键
重试超时的 LLM 调用并不会重新获取相同的答案 —— 而是会采样一个新的。本文将探讨为什么针对非确定性后端的超时重试会失效,以及幂等键如何让它重新变得安全。
当“智能体能做 X 吗?”演变为交付承诺时
当“运行成功一次”的说法经过每日站会、路线图和销售电话后,AI 能力探针会悄然演变为路线图承诺。本文介绍了一套能力测试产物和晋级关卡,旨在防止演示原型在不成熟时就变成合同条款。
Agent 调试器没有断点:为什么追踪优先工作流正在取代单步执行
当输入具有随机性时,单步调试就会失效。替代方案是基于追踪和重放的工作流,它具有四种功能——时间轴拖动、分支对比、扰动重放以及每一步的意图恢复——这些功能与 IDE 的调试工具栏完全不同。
AI 功能的自带密钥 (BYOK):没人预估过成本的销售驱动型架构重构
BYOK 看起来只是一个身份验证开关,但它同时改变了你的信任、成本和运营边界。以下是大多数团队低估了的架构工作。
组合性税收:为什么增加工具会让你的规划器性能下降
你添加的每一个工具都会使规划器的准确率曲线向下弯曲。解决方案是引入一个退役指标 —— 频率 × 成功率 × 下游提升 —— 并设立单一的目录所有者。
无故障停机情况下的面向客户 AI 质量退化复盘指南
状态页显示正常,错误率为零,但客户依然不满意。这是一份关于在没有发生系统崩溃时编写 AI 质量退化复盘报告的实战指南——涵盖了根因术语、严重程度分级以及闭环后续跟进的节奏。
AI 工程师的前 90 天:一份在六周文档失效期内依然有效的入职指南
一份为 AI 工程师准备的 90 天入职计划,用观摩 Eval 评审、受监督的 Prompt 差异比对和端到端裁判模型校准,取代陈旧的架构文档。
免费层级流量才是你真实的评估集
针对付费用户队列的追踪记录来对 LLM 进行评分,实际上是在针对简单的分布进行评分。仍在犹豫是否升级的群体主要集中在免费层级 —— 而评估集往往忽略了这一点。
内部评估集:一个无人审查的隐私边界
AI 团队通常根据生产环境的对话来评估模型,并将其称为内部数据集。根据目的限制原则,这其实是一个未经审查的独立数据处理环节。
延迟感知工具选择:当“当下的足够好”优于“未来的最出色”
智能体提示词中的静态工具描述在实时延迟和错误率面前会逐渐失效。提示词中的运行时“等待成本”信号,是将工具选择从僵化的评估产物转变为路由决策的关键。