跳到主要内容

你的 AI 路线图需要一个“停用”列

· 阅读需 12 分钟
Tian Pan
Software Engineer

看看任何 AI 产品的路线图,你都会发现用来列出准备发布之物的分栏:一个新的智能体、一个更好的检索流水线、一次模型升级、一次微调。每一项都是一个“诞生”。看板上没有任何一项代表“死亡”。没有一栏是留给你将停止支持的模型、将停用的提示词、将归档的评估集或将关闭的功能的。路线图从构造上来说就是乐观的——它们是你承诺去创造的未来清单。

对于确定性软件来说,这种遗漏并无大碍,因为你两年前发布的功能在你不改动它时大多能保持运行。但对于 AI 系统来说,这却是无声的灾难,因为无论你是否触碰它们,你发布的东西都在腐化。针对 GPT-4 的特性而优化的提示词,在提供商调整模型的那一天就会退化。针对去年的失败模式编写的评估套件,将不再能衡量任何真实的问题。你所依赖的模型可能会收到一个你并未规划的 60 天弃用通知。一份只规划发布的路线图,在它未追踪的每一行中都在积累隐形负债。

解决方案不是在现有的看板上施加更多的纪律,而是一个结构性的改变:增加一个“退役”栏,并将“下线”视为一种一等公民的交付物,配备负责人、日期和完成的定义——就像对待发布一样。这篇文章将探讨为什么 AI 特别迫使我们做出这种改变,哪些内容属于这一栏,以及如何运行它而不让它变成一个充斥着美好愿望的墓地。

为什么 AI 的腐化方式与软件不同

传统的技术债务是你主动选择承担的。你发布了一个捷径,给未来的自己写了一张欠条,债务就以固定的利率存在那里,直到你偿还为止。它不会自己变糟。你在 2022 年编写的代码所做的事情与它在 2022 年时完全一致。

AI 债务则不然,因为它的三个核心要素是从外部开始腐烂的:

  • 模型会腐化,因为提供商在变动它们。 领先的提供商通常以 12 到 18 个月的节奏让模型退役,通常在端点关闭前仅有几周的预警。你无法选择时机,只能接受。当一个模型退役时,与其紧密耦合的应用需要重新架构,而那些“改进”后的替代品即使在基准测试中得分更高,也会表现出不同的偏差,并生成细微差别的响应。
  • 提示词会腐化,因为它们是针对行为而非规范进行调整的。 生产环境中的提示词很少是纯净的规范。它是补丁的堆砌,每一个补丁都适配特定模型版本的行为特性。当该模型在你脚下发生变动时,那些补偿其弱点的补丁就变成了噪音——或者是主动的负债。研究表明,仅仅是格式和用词的改变,就能让少样本准确率波动数十分。提示词隐性地针对一个你已不再拥有的模型版本。
  • 评估集会腐化,因为世界在进步。 评估套件是你编写它时所知道的失败模式的快照。它保持不变运行的时间越长,它衡量你已解决问题的程度就越多,而捕捉你现在实际面临问题的能力就越少。基于过时套件的绿色评估仪表盘比没有仪表盘更糟糕,因为它制造了虚假的信心。

把这些因素结合起来,你就会得到一个“无所作为”并非中立行为的系统。你六个月前发布的成果并没有保持其价值。它正在贬值,而这种贬值是无形的,直到生产环境出现故障,或者一封弃用通知邮件落入一个无人看管的收件箱。

这就是路线图必须吸收的核心不对称性。在软件中,发布物的默认状态是稳定。在 AI 中,发布物的默认状态是腐化。一个为前者设计的规划工具,会系统性地低估后者的预算。

哪些内容属于“退役”栏

这一栏不是清理工单的堆积。它是一个前瞻性的账本,记录了你明确决定终止的事项,每一项都带有你对发布所要求的相同元数据:负责人、目标日期、触发条件和完成定义。以下是实际进入该栏的内容:

你依赖的模型版本,及其预期的寿命结束日期。 生产环境中的每个模型在你采用它的那一天就该有一行记录,而不是在提供商警告你的那一天。这一行承载着提供商声明的支持窗口(或你的最佳预测)、你开始迁移测试的日期,以及你将切换到的备选方案。其目的是将外部意外转化为内部里程碑。当弃用通知到达时,工作已经安排就绪,而不是演变成一场紧急事件。

绑定到退役模型的提示词及其版本。 当一个模型进入退役栏时,每个针对它调整的提示词都继承了一个依赖项。这些提示词需要有自己的记录:重写、针对后续模型重新测试,或者如果它们服务的功能将消失,则彻底停用。在这里,提示词债务是深思熟虑地被偿还,而不是在停机期间被动发现。

不再反映现实的评估集和基准测试。 评估套件应该像食品一样有一个“有效期”。过了那个日期,就必须有人负责决定是刷新它、将其权重重新分配给当前的失败模式,还是将其归档。归档一个过时的评估是一项真实的交付物——它能阻止套件对你撒谎。

你准备关闭的功能和入口。 并非每个 AI 功能都能证明其存在的价值。有些是发布的实验,只吸引了少量的受众,现在的维护、监控和迁移成本已经超过了它们的收益。在退役栏中,你可以指名道姓并设定下线日期,使用投资组合经理多年来在旧应用中使用的相同退役触发器:低使用率、相对于价值的高成本、安全或合规风险,以及与新入口的冗余。

构建在即将消失的基础模型之上的微调模型和适配器。 微调模型是基础模型的下游。当基础模型被弃用时,微调模型就处于借来的时间里,而重新训练并非没有代价。这种依赖关系在基础模型开始倒计时那一刻就应该出现在看板上。

加载中…
References:Let's stay in touch and Follow me for more thoughts and updates