你的 Agent 学会了致敬的那个错别字
微调让模型学会像你的语料库一样表现——包括其中的错别字、犹豫语气和某位客服的口头禅。本文剖析这种继承是怎么发生的,以及能拦截它的那道整理工序。
无法收敛的验证器循环
Worker-critic 代理循环承诺向质量收敛,但很少真正兑现——验证器是一个随机策略,max-iterations 上限是披着质量门外衣的预算门,而能恢复终止性的模式都把满足曲面当作真正的架构问题来处理。
对话中途耗尽的 Token 预算:为什么免费用户觉得你的模型变笨了
按用户分配的 Token 预算往往在对话中途咬人最狠——静默截断、丢弃工具调用、模型回退都会被用户读成质量退化,而升级转化的对话从未发生。
撒谎的"转移率":当 AI 客服的"成功"掩盖了用户流失
转移率统计的是"沉默",而不是"得到帮助"。同一个数字可能意味着客户问题被解决了,也可能意味着客户已经流失—— 仪表盘没法分辨,直到队列报告出来。
当评审在 A 与 B 之间始终偏袒自己
同厂商的 LLM 评审会让某个 prompt 变体看起来更好,而生产环境却在回退。本文解释为什么家族偏差能骗过所有看板指标, 以及如何用跨厂商集成评审加上人类校准集来修正它。
你的 AI 披露在第三轮就消失了,没人察觉,直到监管者发现
你的法务团队批准的单轮披露评审,无法在为它服务的 Agent 循环中存活——到第十四轮,模型已经在用一份悄悄删掉了「我是 AI」的摘要回答用户,而这个缺口如今是一个有牙齿的监管责任。
推理账单:没人愿意背的损益表科目
推理已经占到企业 AI 支出的 85%,但组织架构里仍然把它当成工程线下的一项杂项。真正的解法是:一个有名有姓的预算负责人、一条分摊规则,以及一个事先约定好的关停阈值——这三样工具都帮不了你,得你自己谈出来。
多模态追踪:当各种模态必须共享一个 ID
当语音、视觉和 LLM 各自打开自己的根 span 时,多模态 Agent 就让 span 树支离破碎。修复办法是:一个轮次 ID、附着的工件,以及一个对接合层负责的所有者。
一路重试穿过你限流器的 agent
你的 token bucket 衡量的是用户点击;账单衡量的是模型调用。当一次点击扇出成三十次调用,HTTP 边界上的限流器就变成了一把纸糊的伞。
长出胳膊和腿的缓存提示词前缀
六个月前你的提示词前缀是 4k tokens,几乎可以摊销到免费。今天它是 11k tokens,你的缓存命中率是 31%,没有人能指出是哪个 PR 干的。
在用户说"是"之前就已提交的流式响应
流式 UX 继承了一个工具调用并不遵守的可逆性契约。本文剖析为何停止按钮无法撤回已发送的邮件,以及修复这一问题所需的框架变更。
当评估指标全看“感觉”时,你的 A/B 测试无法区分两个模型
点击率无法区分用户是真心喜爱一个模型还是仅仅在忍受它。在你信任实验结果并据此选择模型之前,请先证明你的指标能够检测出你故意搞坏的模型。