每次模型升级都会被当作一种简单的“替换”推销给团队:一行配置更改、在延迟、成本或质量上可衡量的提升,以及几天用于吸收新模型怪癖的提示词微调。采购方案展示了每 token 的差值,工程工单列出了发布阶段,FP&A 团队预记了季度节省。接着,评估分值出炉,却没人认得出来。质量在理应提升的地方毫无波动。曾经达成一致的两个评分员现在分歧达 10 分之多。快照套件显示为红色,但差异看起来只是措辞调整。站会上有人提出了那个本应从迁移计划第一天就该出现的问题:模型到底是在针对什么评分?
这是第二张账单 —— 评估重锚税 (eval re-anchoring tax) —— 且它往往比第一张更昂贵。人工标注的参考分数锚定在旧模型的输出分布上。作为评委的 LLM 评分器针对旧模型的失败模式进行了校准。快照固定装置捕捉的是旧模型的措辞。团队对“优质输出”的直觉是基于旧模型的风格特征训练出来的。在模型替换中,这些都无法完好无损地保留下来。
那些将模型迁移仅视为每 token 差价的团队,注定会在下个季度被劳动力成本惊到。而经历过两次迁移的团队知道,评估系统是与模型耦合的配置,切换模型本质上是一个附带评审账单的配置更改。
更换模型时会失效的四个锚点
一个生产环境的评估系统并非单一产物。它至少包含四个部分,且每一个都默默地锚定在构建它时所针对的模型上。
人工标注的参考分数。 当标注员在三个月前将某个输出的连贯性评为 4 分(满分 5 分)时,他们是针对旧模型输出的隐含分布进行评分的。新模型的输出处于该分布的不同区域 —— 通常是因为模型变得更冗长、或更简洁、列表格式不同,或者使用了不同的限定词进行回避。参考分数无法直接迁移。曾经针对“模型 A 的合格标准”进行评分的标注员,需要针对“模型 B 的合格标准”重新校准,而在产出任何新标签之前,这种重新校准就需要每位标注员花费数小时的工作。
LLM 作为评委的校准。 过去一年的研究不断证明同一个观点:评委缺乏自然的数值校准,7 分(满分 10 分)的含义取决于被评审的模型、评委自身的版本、提示词措辞以及日期。模型版本间的校准漂移现在已有充足记录,以至于“评委是稳定的”这一假设已不再成立。更糟糕的是:当评委和生成器属于同一家族时(例如 Claude 评审另一个 Claude,OpenAI 模型评审另一个 OpenAI 模型),自我偏好偏见 (self-preference bias) 会悄然潜入,而改变这一组合中任何一方的迁移,都可能系统性地改变分数,而这与质量毫无关系。
快照测试固定装置。 快照套件假设“等效输出”意味着“除了空格外,字面上完全相同的字符串”。模型迁移几乎总是打破这一假设。新模型在结构上等效的答案会使用不同的措辞、不同的句子顺序、不同的列表样式。每个快照都变成了差异 (diff)。团队要么重写每个固定装置(成本高昂,且会让套件重新锚定到新模型上,失去了与旧模型的对比),要么将快照匹配削弱为语义检查(这消除了套件原本要提供的回归防护)。
团队直觉。 这是最难显现且重建成本最高的一项。在观察了六个月的模型输出后,评审员了解它的特征:它如何回避问题、它如何屈服于某种特定的质疑、它幻觉出函数签名的具体方式。这种直觉存在于团队成员的脑海中,而在新模型上,它是错误的。在切换后的前三周,团队仍在使用旧的思维模型进行判断,他们在提示词修改上的 PR 评审会出现细微的校准偏差。
意外季度的剖析
批准迁移的采购对话通常是这样的:每 token 价格下降了多少百分比,延迟提升了多少百分比,供应商发布了看起来很不错的基准测试数据,团队承诺了一个日期。而那张无人定价的账单会在接下来的两个季度里以劳动力成本的形式出现:
- 针对新模型的分布,对评估集的代表性样本进行重新标注
- 针对新鲜的人工参考,校准每个 LLM 评委
- 重写或削弱快照固定装置
- 运行并行评估期,让两个模型对相同的输入进行评分
- 调查差异案例,并决定哪个模型的答案实际上是正确的
- 重新校准团队的思维模型 —— 这种不会出现在 Jira 工单上的软技能
我合作过的一个团队为一个受成本目标驱动的 Sonnet 到 Haiku 的迁移预算了两周时间。模型更换和提示词重调按时完成。但评估重锚又花了七周时间。该项目的总成本是发布后首季度每 token 节省预期的 4.5 倍。采购方案中从未提及这七周时间;它们以“工程人力”的形式出现在另一个成本中心,这正是此类超支对 FP&A 隐身并不断重复的原因。
包含“重锚定”阶段的迁移指南
修复方法是流程性的,而非技术性的。那些能够正确评估迁移成本的团队,会将“重锚定”(re-anchoring)视为一个明确的阶段,拥有独立的预算和退出标准。
提交前的并行运行期。在至少一个完整的评估周期内,旧模型和新模型针对同一评估集进行打分。记录每一个案例的差异。在切换 之前,而非之后,将两个模型意见不一致的情况标记出来供人工审查,因为团队的直觉仍然是基于旧模型校准的,而这种校准正是解决歧义的关键杠杆。如果差异率超过某个阈值(团队根据其能负担的审查量来确定该数值),则暂停切换。
裁判模型校准仪式。在将新模型的裁判分数视为生产信号之前,应针对同样的评分标准(rubric)对新鲜的人工样本(通常几十个案例就足以检测出系统性偏差)进行评分,并将裁判对这些案例的分数与人工分数进行对比。如果相关性与迁移前的基准相比发生了偏移,则更新裁判提示词或评分标准。如果相关性发生了偏移 且团队无法解释原因,则暂停迁移,直到找到原因为止。
快照测试套件分诊,而非批量重写。要抵制在单个 PR 中针对新模型“重新生成所有快照”的诱惑。这种做法会默默地将套件重锚定到新模型上,而没有与旧模型进行任何对比——这正是该套件本应防止的失败。相反,应该逐一检查失败的快照,确定该差异是回归(regression)还是仅仅是措辞变动,并为快照固件(fixture)标注捕获它时所使用的模型版本。测试套件的目的是让模型更换变得 可见,而不是为了让它变绿。
版本化评分标准。评分标准文档——即关于“好”的定义的书面描述——应该是一个被签入的代码资产,与提示词和模型一起进行版本化。每个评估分数都应标注其评分时所依据的标准版本。如果没有这一点,团队最终不得不回答“六个月前我们对质量的定义是什么”,却无法给出答案,因为标注者头脑中的标准已经发生了偏移,且没有留下任何记录。
预算内的人工审查成本。迁移任务单中应包含人工审查工时的分列项目,其估算是根据评估集的大小和团队历史标注速率计算得出的。这是采购部门永远看不到的项目,因为工程团队将其作为“产能”内部消化了;但如果诚实地将其列出,它将改变哪些迁移实际上能通过成本效益评估。
财务计划与分析(FP&A)团队缺失的成本视角
模型迁移并不是免费的替换。它是一个具有可量化成本的“重锚定”事件。该成本由三部分组成:更换模型的工程工作、针对新模型特性重新调优提示词的工程工作,以及将评估系统重锚定到新模型输出分布上的人工审查工作。前两项通常会被计入迁移计划,而第三项几乎从未被计入,但在大多数迁移中,它却是三者中成本最大的。
让财务部门理解这一点的框架是将评估集视为一种贬值资产,就像训练语料库一样。它有一个锚定模型,当锚点改变时,资产必须重新估值。重新估值会产生劳动力成本。这项劳动力成本是迁移中隐藏的分列项目,如果团队不将其公开,那么每当供应商发布新模型时(在当前的节奏下,至少每季度一次),他们都会被同样的超支问题所困扰。
在采购沟通中一个有用的表达方式是:新模型节省的每 Token 成本,必须能够覆盖摊销后的重锚定成本,加上过渡期间并行运行两个模型的持续成本。对于小型迁移(单一功能、精简的评估集、小团队),这个门槛很低。对于涉及数十个提示词和庞大评估语料库的平台迁移,门槛可能高到节省的成本不足以证明此时迁移的合理性,而正确的答案是推迟迁移,直到可以将两到三个模型版本合并到一次重锚定事件中。
架构启示
将评估系统视为与模型耦合的配置。这种耦合是隐性的——它存在于人工锚定的参考分数、裁判校准、快照措辞以及团队直觉中——但它是真实存在的,忽略它并不会让劳动力消失。它只是将劳动力转移到了不同的季度和不同的成本中心。
内化了这一点的团队不再将模型更换视为工程计划中的单行任务,而是将其视为一个结构化的重锚定事件,具有明确的阶段、并行运行的准入闸口、裁判校准仪式以及预算内的人工审查成本。迁移在日历时间上变慢了,但在“意外季度”的账目上变便宜了,而这正是大多数团队在经历过上一次迁移后发现自己本该做的权衡。
不这样做的团队则会支付双倍代价。采购方案在每 Token 成本上赢了,但组织在劳动力成本上输了。而且,在团队还没完成上一次迁移的收尾工作之前,下一个供应商关于更快速、更便宜模型的公告就已经发布了。
会员专享
余下内容仅对会员开放。
会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
- —完整文章,包含未公开存档的部分
- —可落地的工作框架,附带权衡与决策依据
- —新文章抢先看,先于公开发布
随时取消 · 一次订阅,畅读全部