LLM 工具表面的契约测试:当供应商更改字段而你的智能体静默适应时
当供应商重命名工具响应字段时,你的智能体不会崩溃 —— 它会自行适应并交付一个质量下降的答案。为什么微服务契约测试必须迁移到智能体技术栈,以及如何进行配置。
确定性预算:将随机性视为按层面的分配,而非全局开关
温度不是一个全局开关。应按层面分配随机性——路由、解析、合成、生成、探索——否则你将为不需要的方差付出代价。
评估作者的单一文化:为什么你的基准测试会变成一张自画像
评估套件并不是对你模型的测量——它是编写者的一张静态画像。在绿色的 CI 变成一个自我陶醉的谎言之前,请审计、轮换并消除基准测试中的单一文化。
评估框架(Eval Harness)而非提示词,才是你真正的供应商锁定
重写提示词是切换 LLM 供应商时最简单的部分。评估框架才是真正的供应商锁定所在 —— 当你尝试重新协商时,真正的账单就会随之而来。
评估集作为模拟器的偏移:当离线指标提升而生产表现恶化时
一个 LLM 评估套件就是一个模拟器。如果跳过重新校准周期,你可能会针对一个在第三个月就不再像生产环境的数据集发布六个“全绿”版本。
当你的评测结果不一致时:在数据互相矛盾时的一套信号优先级体系
对于提示词变更,四种不同的评测信号很难完全一致。如果没有一套明确的优先级体系来规定在何种情况下以哪个信号为准,那么每个发布周都会变成一场关于“该信任谁的数据”的争论。
倒置智能体:当用户是规划者,模型是步骤执行者时
大多数智能体产品让模型负责规划,而让用户负责审批。对于高风险工作,这种极性恰恰相反 —— 解决方案是一个不同的产品设计,而非更优的提示词。
评估困局:当你的 LLM 评测器比被评分的模型更聪明时
当负责评分的 LLM 变得更敏锐时,即使你的系统没有变化,得分也会下降。本文将介绍如何区分评测器偏移与模型回归,并停止对错误的工具进行调试。
30 天 Prompt 见习计划:当“阅读代码”失效时,如何入职工程师
一段 200 行的系统 Prompt 没有函数签名,没有测试,且 diff 历史完全没有说明为什么每一行代码会出现在那里。这份为期 30 天的课程——涵盖失败案例集、消融实验、PR 重构和受控编辑——旨在教导新工程师通过询问其行为来“阅读”一个 Prompt。
Prompt Bisect:通过二分查找定位破坏 Eval 的修改
一夜之间 eval 分数下降了两个百分点,而包含 17 处修改的提示词 PR 应该是一个二分查找问题,而不是一场猜谜游戏。本文将介绍如何像内核维护者通过 bisect 调试内核一样来调试提示词 —— 以及这种方法对团队提交粒度要求的强制规范。
RLAIF 末日循环:当廉价的反馈信号悄然毒害你的微调模型
AI 生成的偏好标签比人类标签便宜 100 倍 —— 它们教导你的模型去迎合裁判的审美,而不是你的用户。
路由即产品:为什么你的低成本分类器比旗舰模型决定了更多行为
成本感知型 LLM 路由让低成本模型成为了大多数用户的实际产品面。如果你的评估体系仍聚焦于旗舰模型,那么你在 70% 的流量上都是盲目的 —— 这里有能解决该问题的“路由即产品”框架。