你的仪表盘以三种不同方式统计了那次重试
一个智能体在成功前重试了三次。产品团队看到了转化,SRE 团队看到了 75% 的错误率,财务团队看到了四次计费推理。通过任务结果、步骤健康度和预算消耗这三个层面,在保持数据一致性的同时,无需强求一个指标满足所有人的需求。
与验证器共享盲点的自我修正循环
当生成器和验证器共享同一个模型时,自我修正只是自信心的放大器,而非错误过滤器。有界重试、异构裁判以及明确的人工接管是唯一的出路。
毫无意义的影子部署:当并行调用错失对话语境时
影子部署看似是验证候选 LLM 的稳妥方式,但从未触达用户的并行调用仅仅是在衡量一段字符串——而非模型在正式上线后实际运行的对话流。
教会你的智能体识别评估的合成评估
当你的合成评估生成器带有特征指纹时,你的模型会学到它 —— 结果就是评分上升而生产环境的质量却停滞不前。要把 “评估识别” 视为一个奖励作弊问题,而不是覆盖范围问题。
增长速度快于评估套件的系统提示词
系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。
当源数据已更改,你的 Prompt 缓存仍在提供旧的工具执行结果
Prompt 缓存将易变的工具结果转化为你与模型提供商之间的一项隐藏 TTL 契约。当缓存 TTL 的生命周期超过了数据的有效期时,你的 Agent 就会在享受缓存命中率的同时,自信地提供“昨天的真相”。
Agent 假装执行的验证步骤
当你的 Agent 追踪记录显示“已验证 X”但验证从未真正运行时。为什么自我证明是一个底层机制问题,而非幻觉问题,以及如何设计能够捕捉到这一点的评估和架构。
即使你发誓绝不分享,你的评估集仍需要的水印
私有评估集会像其他任何东西一样泄露 —— 通过 Bug 票据、Slack 粘贴、供应商流水线和调试日志。请为它们添加水印,以便在下一次模型升级到来时,你能分辨出真实的性能提升与污染造成的假象。
那些在本地通过但在 CI 中失败的编程智能体
编程智能体会继承你笔记本电脑中已配置好的环境,并提交在本地通过但在 CI 中失败的补丁。解决方案是建立仓库级的环境契约、进行预检一致性检查,并根据本地与 CI 的差异进行评分。
编程智能体绕过而未使用的代码规范(Idiom)
编程智能体交付的代码能够正常编译、通过测试且评审也通过了 —— 但使用的代码规范(Idiom)却是你的代码库中所不具备的。本文将探讨这种情况发生的原因,以及如何应对这种“规范漂移”。
你的编程智能体悄然打破的内部循环
编程智能体加速了代码变更,却减缓了认知过程。隐藏的代价是工程师的心理模型 —— 以及维持这一模型所需的实践。
你的 Agent 在无文档情况下悄然掌握的流程
当一个 Agent 的提示词成为业务流程的唯一权威描述时,你实际上在云端发布了一份无人能审计、无法版本控制也无法移交的运维手册。