跳到主要内容

双速路线图:当模型基准每季度都在移动时如何规划 AI 功能

· 阅读需 10 分钟
Tian Pan
Software Engineer

有一种特定的遗憾,只发生在 AI 团队中。你花了一个季度的时间构建了一个复杂的变通方案——多步提示词链、自定义重排序器(reranker)、手动调优的工具路由层——然后上线。它起作用了。但六周后,一个新模型发布,一次调用就能原生完成所有这些工作,你一个季度的工作现在变成了必须清除的累赘。功能没有失败。底座(Floor)移动了。

这是 2026 年规划 AI 功能的结构性问题:你构建其上的底座改进速度快于你的发布周期。从 2023 年到 2025 年中期,前沿实验室大约每六个月发布一次。到 2026 年第一季度,这一周期缩短至大约每四周发布一次重大版本,甚至出现过五个实验室在 13 天内密集发布的情况。在你规划和发布之间,你脚下的根基正在发生变动。

大多数团队的本能是加大规划力度——更长的路线图、更严谨的规格说明、更多的前期设计。这种本能恰恰是背道而驰的。当底层能力是一个不断变动的目标时,更长的计划只意味着一张更长的清单,列满了会被下一次模型发布作废的赌注。相反,你需要一个以“双速”运行的路线图:一条轨道用于处理那些随着模型改进而变得更好的事物,另一条轨道用于处理那些随着模型改进而被删除的事物。它们不是同一种工作,不应该以同样的方式获得资金,而将它们混为一谈正是为什么这么多 AI 工程努力会付诸东流。

AI 功能所属的两大类别

你围绕模型构建的每个功能都在对你的工作与模型轨迹之间的关系做一个隐性赌注。只有两种赌注,且它们的方向完全相反。

复利型赌注(Compounding bets)随着模型的改进而变得更有价值。 这些是无论模型变得多么聪明,都无法为你代劳的事情,因为它们不是能力问题,而是访问权限和上下文问题。你专有的数据管道。你对模型没有凭据访问的系统的集成。编码了你所在领域中“正确”含义的评估套件。你客户的历史上下文。当模型变得更聪明时,这些资产会让它做得更多,而不是更少。一个连接到你独特数据的更好模型会产生更好的输出;一个什么都没连接的更好模型只是一个任何人都可以租用的更好的聊天机器人。

贬值型赌注(Depreciating bets)随着模型的改进而变得价值降低。 这些是针对当前模型局限性的变通方法。你因为模型无法推理而编写的思维链(chain-of-thought)提示工程。你因为模型无法维持多步计划而构建的编排框架。你维护的输出解析器,因为模型无法可靠地生成结构化数据。每一个变通方案的存在都是为了弥补一个缺口,而各大实验室正在投入数十亿美元来填补正是这些缺口。实际上,你正在与模型的路线图赛跑——而你注定会输。

最清晰的历史案例是推理脚手架。在大约两年的时间里,整个细分行业都在构建思维链包装器、多步计划器和自我批判循环,因为模型本身无法可靠地进行推理。随后,推理能力被直接植入模型内部。脚手架没有变强,而是被删除了。那些将其视为持久基础设施的团队不得不面对迁移;而那些将其视为消耗品的团队则耸耸肩并将其移除。

为什么“仅仅构建变通方案”是一个隐藏的负债

陷阱在于:贬值型工作在当下往往看起来是负责任的工程选择。模型无法可靠地执行 X,客户需要 X,所以你为 X 构建了脚手架。这没错。错误在于你如何构建它——采用了与其他系统相同的持久性假设。

构建得像永久基础设施一样的变通方案会累积无形的负债。它会有测试覆盖、文档、清晰的抽象以及在架构图中的一席之地。一旦模型吸收了该能力,所有这些投资就成了沉没成本;更糟糕的是,由于现在有另外三件事依赖于它,这种抽象会主动阻碍移除。LlamaIndex 团队曾将此描述为“脚手架层的坍塌”——为补偿模型弱点而存在的复杂中间件随着弱点的消失而被吞噬,而那些持有工程化程度最高的版本的团队,往往最难放手。

解决办法不是停止构建变通方案,而是要以可抛弃的方式构建它们,并贴上相应的标签。有效的衡量标准是“六个月测试”:在投资任何工具之前,询问当模型在六个月后改进时,它是否仍然有用。如果诚实的回答是否定的,那么就明确地将其构建为临时的——优先考虑速度而非健壮性,通过清晰的接口将其隔离以便于切除,并写下移除触发条件。“当模型能可靠地在 99% 以上的情况下生成结构化输出时,删除此解析器。”记录处置标准就是全部的准则。一个写有过期日期的变通方案是一个工具;而一个没有过期日期的相同方案则是没人敢移除的技术债务。

加载中…
References:Let's stay in touch and Follow me for more thoughts and updates