跳转到主要内容

双速路线图:当模型基准每季度都在移动时如何规划 AI 功能

阅读需 1 分钟Tian PanTian Pan

有一种特定的遗憾,只发生在 AI 团队中。你花了一个季度的时间构建了一个复杂的变通方案——多步提示词链、自定义重排序器(reranker)、手动调优的工具路由层——然后上线。它起作用了。但六周后,一个新模型发布,一次调用就能原生完成所有这些工作,你一个季度的工作现在变成了必须清除的累赘。功能没有失败。底座(Floor)移动了。

这是 2026 年规划 AI 功能的结构性问题:你构建其上的底座改进速度快于你的发布周期。从 2023 年到 2025 年中期,前沿实验室大约每六个月发布一次。到 2026 年第一季度,这一周期缩短至大约每四周发布一次重大版本,甚至出现过五个实验室在 13 天内密集发布的情况。在你规划和发布之间,你脚下的根基正在发生变动。

大多数团队的本能是加大规划力度——更长的路线图、更严谨的规格说明、更多的前期设计。这种本能恰恰是背道而驰的。当底层能力是一个不断变动的目标时,更长的计划只意味着一张更长的清单,列满了会被下一次模型发布作废的赌注。相反,你需要一个以“双速”运行的路线图:一条轨道用于处理那些随着模型改进而变得更好的事物,另一条轨道用于处理那些随着模型改进而被删除的事物。它们不是同一种工作,不应该以同样的方式获得资金,而将它们混为一谈正是为什么这么多 AI 工程努力会付诸东流。

AI 功能所属的两大类别

你围绕模型构建的每个功能都在对你的工作与模型轨迹之间的关系做一个隐性赌注。只有两种赌注,且它们的方向完全相反。

复利型赌注(Compounding bets)随着模型的改进而变得更有价值。 这些是无论模型变得多么聪明,都无法为你代劳的事情,因为它们不是能力问题,而是访问权限和上下文问题。你专有的数据管道。你对模型没有凭据访问的系统的集成。编码了你所在领域中“正确”含义的评估套件。你客户的历史上下文。当模型变得更聪明时,这些资产会让它做得更多,而不是更少。一个连接到你独特数据的更好模型会产生更好的输出;一个什么都没连接的更好模型只是一个任何人都可以租用的更好的聊天机器人。

贬值型赌注(Depreciating bets)随着模型的改进而变得价值降低。 这些是针对当前模型局限性的变通方法。你因为模型无法推理而编写的思维链(chain-of-thought)提示工程。你因为模型无法维持多步计划而构建的编排框架。你维护的输出解析器,因为模型无法可靠地生成结构化数据。每一个变通方案的存在都是为了弥补一个缺口,而各大实验室正在投入数十亿美元来填补正是这些缺口。实际上,你正在与模型的路线图赛跑——而你注定会输。

最清晰的历史案例是推理脚手架。在大约两年的时间里,整个细分行业都在构建思维链包装器、多步计划器和自我批判循环,因为模型本身无法可靠地进行推理。随后,推理能力被直接植入模型内部。脚手架没有变强,而是被删除了。那些将其视为持久基础设施的团队不得不面对迁移;而那些将其视为消耗品的团队则耸耸肩并将其移除。

为什么“仅仅构建变通方案”是一个隐藏的负债

陷阱在于:贬值型工作在当下往往看起来是负责任的工程选择。模型无法可靠地执行 X,客户需要 X,所以你为 X 构建了脚手架。这没错。错误在于你如何构建它——采用了与其他系统相同的持久性假设。

构建得像永久基础设施一样的变通方案会累积无形的负债。它会有测试覆盖、文档、清晰的抽象以及在架构图中的一席之地。一旦模型吸收了该能力,所有这些投资就成了沉没成本;更糟糕的是,由于现在有另外三件事依赖于它,这种抽象会主动阻碍移除。LlamaIndex 团队曾将此描述为“脚手架层的坍塌”——为补偿模型弱点而存在的复杂中间件随着弱点的消失而被吞噬,而那些持有工程化程度最高的版本的团队,往往最难放手。

解决办法不是停止构建变通方案,而是要以可抛弃的方式构建它们,并贴上相应的标签。有效的衡量标准是“六个月测试”:在投资任何工具之前,询问当模型在六个月后改进时,它是否仍然有用。如果诚实的回答是否定的,那么就明确地将其构建为临时的——优先考虑速度而非健壮性,通过清晰的接口将其隔离以便于切除,并写下移除触发条件。“当模型能可靠地在 99% 以上的情况下生成结构化输出时,删除此解析器。”记录处置标准就是全部的准则。一个写有过期日期的变通方案是一个工具;而一个没有过期日期的相同方案则是没人敢移除的技术债务。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 9 分钟

“以后再加评估”的陷阱:测量债务如何产生复利效应

跳过评估能让你在一个季度内发布得更快,但接下来的四个季度会变慢。本文探讨了测量债务如何产生复利效应、早期的预警信号,以及防止这种偏移的组织级强制机制。

insider
evals
阅读需 9 分钟

脚手架审计:每一次模型发布都让你的部分开发框架变成累赘

重试机制编排、JSON 修复解析器以及强制思维链,都是为你不再运行的模型而构建的。这是一套在每次模型升级时,对过时的 LLM 脚手架进行标记、消融和删除的实用规范。

insider
ai-engineering
阅读需 9 分钟

集成 vs. 辩论:两种多模型验证范式及其失效场景

运行更多模型并不保证更好的答案。当前沿 LLM 共享训练数据时,它们的错误相关性达到 r = 0.77 —— 使得三个模型实际上仅相当于 1.3 个独立模型。本文将深入分析集成与辩论验证、它们各自的失效模式,以及当两种方法都失效时的情况。

insider
multi-agent
阅读需 8 分钟

你在廉价模型上测试,却在昂贵模型上部署

在廉价模型上运行 CI 和评估,而生产环境却使用尖端模型,这在最关键的地方破坏了开发与生产环境的一致性。本文将探讨为什么层级差距会使你的评估门控失效,以及缩小这一差距的预算计算方法。

insider
llm
阅读需 10 分钟

思维的 p99:当模型决定你的请求耗时多久

推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。

insider
llm