AI 路线图:押注于尚不存在的模型
有一句特定的短语应该让每一位工程主管立刻叫停会议:“只要模型变强,这就没问题了。”说这句话的人通常信心满满,有时还会配上一张展示能力曲线向上弯曲的幻灯片,而这几乎总是标志着路线图悄然从一份计划变成了某种预测。
这种区别比听起来更重要。计划是你所控制的一系列事情:你将编写的代码、你将构建的集成、你将运行的测试。预测是对你无法控制的事情的押注 —— 在这种情况下,是一个尚不存在的模型,它由一个从未承诺过交付日期的供应商按其时间表发布。当你围绕 “上下文窗口将翻倍” 或 “到第三季度推理能力将足够好” 来规划功能时,你并没有消除问题中最难部分的风险。你只是把它转移到了别人的发布日程表上,并宣称已经完成了。
这并不是反对雄心壮志。能力 确实 在快速提高,假装不是这样本身就是一种失职。METR 被广泛引用的测量结果显示,在过去六年里,前沿智能体能够自主完成的任务长度大约每七个月翻一倍 —— 而在 2024–2025 年期间,这一速度接近每四个月翻一倍。这是一个真实且陡峭的曲线,如果构建产品时假设 模型会保持停滞,你就会被甩在后面。问题不在于乐观。问题在于 “模型会进步” 被用来终结那些进步的模型实际上无法回答的设计问题。
预测损失并不等同于预测行为
规模法则 (scaling-laws) 文献在预测一件事上确实令人印象深刻:训练损失 (training loss)。给定算力、数据和参数量,你可以极其准确地预测模型对训练分布的拟合程度。这是让实验室在不盲目飞行的情况下规划数亿美元训练运行的经验基石。
但路线图幻灯片中很少提到的陷阱是:损失并不是你的功能所依赖的东西。你的功能依赖于推理、鲁棒性、在对抗性输入下的指令遵循、校准,以及不存在会破坏你特定工作流的特定故障模式。而那些信任规模法则来预测损失的研究人员也明确表示,如果没有基于任务的评估,这些法则作为推理或通用能力的代理指标要 弱得多。更新的预测工作 —— 那些预测基准测试表现而非损失的方法 —— 之所以存在,正是因为损失到能力的转换是不可靠的。
因此,当有人推断 “GPT-N 在我们的内部评估中是 60%,GPT-N+1 将会是 80%” 时,他们是在一个已知不存在直线的空间里画直线。能力的提升是块状的、在不同任务类型中是不均衡的,甚至在整体基准测试攀升时,在你关心的特定事项上偶尔会是 负增长。GPT-5 在 2025 年的发布就是一个教训:综合数据上升了,但仍有相当一部分用户发现它在处理特定任务时比被取代的模型更差,以至于供应商不得不撤回了强制迁移。如果你把路线图押注在 “下一个模型在所有方面都会绝对更强” 上,那么你从一开始就错了。
交付日期谬误
即使你假设能力终将到来 —— 事实上,对于许多事情来说,它确实会到来 —— 你也做了第二个更隐蔽的赌注:它会在 你需要的时候 到来,并且在它到来时你能够 访问它。
这两个假设现在都变得更加动摇,而不是更加稳固。前沿模型的发布现在会跳票,会因为安全审查而分阶段进行,偶尔还会受到与你的产品时间表毫无关系的审批流程限制。两周的延迟听起来微不足道,直到这两周恰好落在你的发布日期和一个尚不存在的模型之间。而且,“一旦发布我们就升级” 假设了几乎无法在实际接触中幸存的即插即用兼容性 —— 新模型会带来新的分词器 (tokenizer)、新的拒绝行为、新的延迟特征以及新的提示词敏感度,这些都会悄无声息地破坏你围绕旧模型构建的框架。
令人不安的重构:一份依赖于未发布模型的路线图,在关键路径上依赖于供应商的内部时间表,而其风险成本被定价为零。 你绝不会接受一个建立在没有出货日期、没有 SLA 的芯片之上的硬件计划。不知何故,“到那时模型会更好” 却因为幻灯片上的曲线如此有说服力而获得了通行证。
如何区分能力押注与一厢情愿
并非所有的前瞻性押注都是鲁莽的。那些处理得很好的团队并不是拒绝预测进展的团队,而是那些能够准确说明自己在押注什么,以及如果输了会发生什么的团队。以下几个问题可以将合理的押注与愿望区分开来:
- 具体需要改进什么,改进多少? “推理能力会变好” 是一个愿望。“模型需要能够处理 12 步的工具调用链且在第 6 步之后不掉链子,而目前的顶级模型只能处理 4 步” 是一个押注。第二个你可以衡量、针对每次发布进行跟踪并进行论证。第一个只是一种情绪。
- 这种改进是符合趋势还是偏离趋势? 赌智能体明年的任务跨度会稍微变长,是顺应有据可查的曲线。赌模型会突然停止对结构化输出产生幻觉,或者对自己的信心变得准确校准,则是押注在趋势线不支持的不连续性上。搞清楚你在做哪一种。
- 你有什么证据表明这是模型的难题而不是你的难题? 令人惊讶的是,大量 “模型还做不到这一点” 的问题实际上是检索问题、上下文构建问题或披着能力外衣的提示词问题。这些问题不会被新模型修复,它们需要由你来修复。
- 提前行动与滞后的成本分别是什么? 在能力具备之前构建好框架通常是廉价且明智的。发布一个只有在能力落地后才能工作的产品是昂贵且脆弱的。区别在于你的产品在今天到底是 无法运行 的,还是仅仅在明天会 变得更好。
最后一个问题是整场游戏的关键,它值得拥有自己的章节。
设计应让更强模型成为增量,而非氧气
在 AI 产品中,最重要的架构决策不是你选择了哪个模型。而是更强的模型究竟是增量(Upside)还是氧气(Oxygen)——即下一次模型发布是会让你的产品锦上添花,还是你的产品在它问世之前根本无法运行。
“氧气依赖型”设计非常有诱惑力,因为它们在经过筛选的示例中表现惊人,让你能跳过那些乏味的工程环节。“只要模型足够聪明,我们就不再需要检索层、验证步骤、人工审核或回退路径了。” 每一次这类删减都是一场赌博,赌一个尚未问世的模型能弥补你选择避开的工作。“增量依赖型”设计则恰恰相反:它们在今天就能买到的模型上运行,以你今天就能交付的质量运作。每当底层模型升级时,它们就会在无需更改代码、不产生发布依赖的情况下,悄无声息地变得更强。
具体而言,为“增量”而设计需要遵循以下几项准则:
- 保持一个能在现有模型上运行的版本。 如果你的功能在当前最强模型下无法达到起码的质量门槛,那它就不是一个路线图项目——而是一场研究性的赌注,应该按研究项目来定性并投入资源。
- 现在就开始构建脚手架,解耦模型。 模型周边的支撑——评估(Evals)、检索、工具定义、护栏(Guardrails)、可观测性——是你能够控制且现在就能开始的真实工程。当更强的模型出现时,你直接将其接入现成的脚手架,而不是在倒计时已经开始时才着手最困难的部分。
- 让模型切换成为配置更改,而非代码重构。 将供应商边界抽象到这种程度:测试下个季度的模型与你的评估套件仅需一个下午,而不是一个专项工程。这也是你如何将“新模型导致任务退化”从一场发布灾难转变为一次简单的“暂不升级”。
- 量化差距。 针对每个新版本,在固定的评估标准上追踪功能的质量。这能将“模型会变强”从一种信念转变为一条你可以据此规划的斜率曲线,并在版本更新出现负面影响时提供早期预警。
做到这一点,能力提升曲线就会回归其本质:成为让成熟产品更上一层楼的助推力,而非支撑一个无法独立运作的产品的拐杖。
与领导层的对话
最终,你的上级会问为什么路线图不能更激进,为什么你没有像其他人一样“假设模型会持续进步”。诚实的回答并不是“AI 不会变得更好”,而是一种比大多数路线图讨论更清晰的界定:计划中的哪些部分属于工程(Engineering),哪些部分属于投机(Speculation)。
工程是你周一就能动工并能大致按期完成的工作。投机则是你寄希望于出现的能力。一个健康的路线图两者兼有——但它会明确标注、区别资助,且绝不会让一个投机性依赖潜伏在关键路径上,伪装成已承诺的交付项。当你指着计划说“这三个功能基于当前模型即可交付;如果下个版本表现符合预期,这两个功能会有质的飞跃;即使新模型跳票,也没有任何功能会瘫痪”时,你就为领导层提供了真正具备决策价值的信息。这比一个由尚未问世的模型暗中背书、看起来激进的时间表要有价值得多。
增长曲线是真实的,能力也在不断进化。但一个由你掌控、且随模型提升而进步的计划,在任何一个季度都能战胜你无法掌控的预测——即使是在那些预测碰巧成真的季度。
- https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/
- https://metr.org/time-horizons/
- https://theaidigest.org/time-horizons
- https://aimultiple.com/llm-scaling-laws
- https://www.buildfastwithai.com/blogs/llm-scaling-laws-explained
- https://arxiv.org/pdf/2502.15850
- https://builtin.com/artificial-intelligence/openai-chatgpt-5-hype
- https://www.pwc.com/us/en/tech-effect/ai-analytics/ai-predictions.html
