LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。
私有评估集往往源自单一模型的生产环境故障,因此它会偏向现任模型,并低估所有挑战者。应将回归测试与能力测试分开,并针对真实的业务流量进行测试。
智能体每周交付数百个 PR,而其中大多数完全没有经过审查。制造业在一个世纪前就通过验收抽样解决了这个问题——利用 AQL 表、批次拒收和转移规则,将对智能体的信任从“凭感觉”转变为明确且可衡量的制度。
宽容地处理格式错误的工具参数看似健壮,但会悄无声息地将 Schema 违规转化为评估无法发现的数据损坏。严格拒绝并提供模型可读的错误反馈,才是让智能体循环具备自纠错能力的关键。
在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
基于路径的 CODEOWNERS 假设作者知道自己在谁的地盘上——而 AI Agent 并不知晓。本文探讨了为什么 Agent 的 diff 会导致评审队列僵局,以及如何通过基于担保人的路由、分目录的自主权预算以及“模式 + 抽样”的 Codemod 评审来解决这一问题。
AI 智能体不会阅读更新日志 —— 它们对你 API 的认知被冻结在 Prompt、工具 schema 和训练数据中。本文将探讨为什么关闭 v1 版本会导致重试风暴而非迁移,以及如何通过适配器、Sunset 响应头和智能体可读的错误信息来解决这一问题。
内部用户会默默地修正 Agent 的错误、规避其弱点,并在 Slack 中分享绕过问题的方法 —— 这使得内部试用指标在真实客户流失前看起来异常完美。你应该转而监测修复事件、编辑距离和冷启动用户群组。
你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。
人类对不稳定测试耸耸肩;Agent 却将报错视为绝对真理——回退正确的更改并在虚影上浪费 token。为什么测试确定性现在已成为一项 SLO,以及 Agent 集群如何检测并修复它们所遭受的不稳定测试。
混沌工程假设故障是可重现的;但 Agent 系统的故障往往通过从不重复的随机路径发生。演练日(Game days)——包括工具故障注入、模型降级演练、上下文污染场景以及升级反馈消防演练——能建立运维人员的肌肉记忆,并暴露重现测试永远无法发现的追踪工具缺陷。