跳转到主要内容

你的 AI 路线图需要一个“停用”列

阅读需 1 分钟Tian PanTian Pan

看看任何 AI 产品的路线图,你都会发现用来列出准备发布之物的分栏:一个新的智能体、一个更好的检索流水线、一次模型升级、一次微调。每一项都是一个“诞生”。看板上没有任何一项代表“死亡”。没有一栏是留给你将停止支持的模型、将停用的提示词、将归档的评估集或将关闭的功能的。路线图从构造上来说就是乐观的——它们是你承诺去创造的未来清单。

对于确定性软件来说,这种遗漏并无大碍,因为你两年前发布的功能在你不改动它时大多能保持运行。但对于 AI 系统来说,这却是无声的灾难,因为无论你是否触碰它们,你发布的东西都在腐化。针对 GPT-4 的特性而优化的提示词,在提供商调整模型的那一天就会退化。针对去年的失败模式编写的评估套件,将不再能衡量任何真实的问题。你所依赖的模型可能会收到一个你并未规划的 60 天弃用通知。一份只规划发布的路线图,在它未追踪的每一行中都在积累隐形负债。

解决方案不是在现有的看板上施加更多的纪律,而是一个结构性的改变:增加一个“退役”栏,并将“下线”视为一种一等公民的交付物,配备负责人、日期和完成的定义——就像对待发布一样。这篇文章将探讨为什么 AI 特别迫使我们做出这种改变,哪些内容属于这一栏,以及如何运行它而不让它变成一个充斥着美好愿望的墓地。

为什么 AI 的腐化方式与软件不同

传统的技术债务是你主动选择承担的。你发布了一个捷径,给未来的自己写了一张欠条,债务就以固定的利率存在那里,直到你偿还为止。它不会自己变糟。你在 2022 年编写的代码所做的事情与它在 2022 年时完全一致。

AI 债务则不然,因为它的三个核心要素是从外部开始腐烂的:

  • 模型会腐化,因为提供商在变动它们。 领先的提供商通常以 12 到 18 个月的节奏让模型退役,通常在端点关闭前仅有几周的预警。你无法选择时机,只能接受。当一个模型退役时,与其紧密耦合的应用需要重新架构,而那些“改进”后的替代品即使在基准测试中得分更高,也会表现出不同的偏差,并生成细微差别的响应。
  • 提示词会腐化,因为它们是针对行为而非规范进行调整的。 生产环境中的提示词很少是纯净的规范。它是补丁的堆砌,每一个补丁都适配特定模型版本的行为特性。当该模型在你脚下发生变动时,那些补偿其弱点的补丁就变成了噪音——或者是主动的负债。研究表明,仅仅是格式和用词的改变,就能让少样本准确率波动数十分。提示词隐性地针对一个你已不再拥有的模型版本。
  • 评估集会腐化,因为世界在进步。 评估套件是你编写它时所知道的失败模式的快照。它保持不变运行的时间越长,它衡量你已解决问题的程度就越多,而捕捉你现在实际面临问题的能力就越少。基于过时套件的绿色评估仪表盘比没有仪表盘更糟糕,因为它制造了虚假的信心。

把这些因素结合起来,你就会得到一个“无所作为”并非中立行为的系统。你六个月前发布的成果并没有保持其价值。它正在贬值,而这种贬值是无形的,直到生产环境出现故障,或者一封弃用通知邮件落入一个无人看管的收件箱。

这就是路线图必须吸收的核心不对称性。在软件中,发布物的默认状态是稳定。在 AI 中,发布物的默认状态是腐化。一个为前者设计的规划工具,会系统性地低估后者的预算。

哪些内容属于“退役”栏

这一栏不是清理工单的堆积。它是一个前瞻性的账本,记录了你明确决定终止的事项,每一项都带有你对发布所要求的相同元数据:负责人、目标日期、触发条件和完成定义。以下是实际进入该栏的内容:

你依赖的模型版本,及其预期的寿命结束日期。 生产环境中的每个模型在你采用它的那一天就该有一行记录,而不是在提供商警告你的那一天。这一行承载着提供商声明的支持窗口(或你的最佳预测)、你开始迁移测试的日期,以及你将切换到的备选方案。其目的是将外部意外转化为内部里程碑。当弃用通知到达时,工作已经安排就绪,而不是演变成一场紧急事件。

绑定到退役模型的提示词及其版本。 当一个模型进入退役栏时,每个针对它调整的提示词都继承了一个依赖项。这些提示词需要有自己的记录:重写、针对后续模型重新测试,或者如果它们服务的功能将消失,则彻底停用。在这里,提示词债务是深思熟虑地被偿还,而不是在停机期间被动发现。

不再反映现实的评估集和基准测试。 评估套件应该像食品一样有一个“有效期”。过了那个日期,就必须有人负责决定是刷新它、将其权重重新分配给当前的失败模式,还是将其归档。归档一个过时的评估是一项真实的交付物——它能阻止套件对你撒谎。

你准备关闭的功能和入口。 并非每个 AI 功能都能证明其存在的价值。有些是发布的实验,只吸引了少量的受众,现在的维护、监控和迁移成本已经超过了它们的收益。在退役栏中,你可以指名道姓并设定下线日期,使用投资组合经理多年来在旧应用中使用的相同退役触发器:低使用率、相对于价值的高成本、安全或合规风险,以及与新入口的冗余。

构建在即将消失的基础模型之上的微调模型和适配器。 微调模型是基础模型的下游。当基础模型被弃用时,微调模型就处于借来的时间里,而重新训练并非没有代价。这种依赖关系在基础模型开始倒计时那一刻就应该出现在看板上。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 9 分钟

双速路线图:当模型基准每季度都在移动时如何规划 AI 功能

前沿模型现在大约每四周发布一次,直接让你上季度开发的临时方案失效。你应该将路线图拆分为:哪些功能会随着模型改进而产生复利,哪些功能会被淘汰,并按照各自的速度进行规划。

insider
ai-engineering
阅读需 10 分钟

随机系统的值班响应:为何你的 AI 运行手册需要重写

传统故障响应假设故障是可复现的,但 LLM 驱动的系统并非如此。以下是如何针对非确定性 AI 重写告警方案、分类决策树和事后分析模板。

insider
ai-engineering
阅读需 8 分钟

无法回滚的功能开关:提示词

提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。

insider
llmops
阅读需 10 分钟

没有预发布模型的预发布环境

托管模型是你无法建立忠实预发布副本的唯一依赖项。本文将探讨为什么 LLM 的预生产一致性会失效,以及版本固定、重放、黄金转录和影子流量如何分别只能填补部分差距。

insider
llmops
阅读需 9 分钟

理解债:没人能看懂的凌晨两点系统

AI Agent 交付了人类从未建模过的整洁代码,而账单却会在凌晨两点的故障处理中如期而至。本文将探讨为什么“理解债”是 Agent 时代的核心运维风险,以及如何保持人类理解与系统同步。

insider
ai-engineering