令人惊讶的是,许多 AI 团队一旦获得 o3 级别或 Claude 扩展思考模型的访问权限,就会默认对所有查询启用扩展思考。这背后的逻辑看似显而易见:更智能的推理等于更好的输出,何不始终开启?问题在于,这种逻辑没有考虑到测试时计算扩展在实践中如何运作的基本事实。扩展思考能显著提升特定类型任务的性能,在另一些任务上则会降低质量,并可能将全局推理成本推高 5-30 倍。那些从这些模型中获取最大价值的团队,将推理预算作为一个明确的决策来对待——其重要性不亚于模型选择或提示词工程。
本文阐述了任务分类体系、成本结构,以及将战略性使用思考预算的团队与仅仅为质量幻觉溢价买单的团队区分开来的路由决策框架。
思考 Token 的计费方式(及其重要性远超你的想象)
扩展思考的机制听起来很简单:在生成可见答案之前,模型会运行一段内部的思维链。令人意外的是,这段内部推理与输出 token 的计费方式完全相同——而且它是不可见的。你在响应中看到 500 个 token 的连贯分析,但实际上已被计费 5,000 个 token。
这不是什么怪癖,而是刻意为之的设计。OpenAI 的 o1/o3、DeepSeek R1 和 Claude 的扩展思考模式,都以输出 token 的费率计算推理 token:
Claude Sonnet 4.6 :15 / 百万输出 t o k e n 。一个生成 1 万个思考 t o k e n 的查询,在可见答案之前就已产生 15/百万输出 token。一个生成 1 万个思考 token 的查询,在可见答案之前就已产生 15/ 百万输出 t o k e n 。一个生成 1 万个思考 t o k e n 的查询,在可见答案之前就已产生 0.15 的费用。
DeepSeek R1 :推理 token 按 $2.19/百万计费。高难度数学题可能产生 2-2.5 万个推理 token,而可见响应可能只有 500 个 token。实际成本是 token 计数器显示值的 50 倍。
OpenAI o3 :定价因推理努力程度(低/中/高)而异。复杂查询的高强度推理可将每次查询的有效成本推至标准费率的 5-10 倍。
这个倍率并不均一——简单问题触发较短的推理链,高难度问题则会急剧膨胀——这意味着若不了解自己的任务分布,就无法可靠估算推理成本。那些在默认开启扩展思考后才在生产环境中发现这一问题的团队,往往是在账单到来之前,延迟指标还没有任何异常时,就已经面临账单惊喜了。
预算控制的存在正是出于这个原因。大多数 API 都暴露了 max_thinking_budget_tokens 或等效参数。当成本可预测性至关重要时,这个参数必须配置,而不是可选项——它是需要首先配置的东西。
决定一切的两类任务
你所见到的扩展推理模型的所有基准测试收益——o3 在 AIME 2024 上解决了 96.7% 的问题,而 o1 只有 56.6%;o3 在 ARC-AGI 上达到 87.5%,而 GPT-4o 仅有 5%——都来自具有共同属性的特定任务类型:中间步骤的正确性至关重要。
当一道数学题需要在推导结论之前正确建立引理时,错误的中间步骤会级联扩散。扩展思考给模型提供了空间,在最终答案中传播之前捕获并纠正这些错误。同样的动态也适用于竞赛编程(在边界情况下追踪执行路径)、复杂代码审查(验证多文件依赖关系间的行为)以及长文档分析(必须解决跨章节的矛盾)。
与此互补的另一类任务——扩展思考收益甚微甚至适得其反——具有不同的属性:质量由输出阶段决定,而非中间推理。这类任务包括:
摘要与提取 :模型需要阅读并重新格式化。思考 token 增加延迟和成本,却不改善简洁性。
分类与路由 :二元或有界多类决策。分类器的准确性由训练分布驱动,而非内部推演。
创意生成 :产品描述、邮件模板、叙事散文。更长的推理链不会改善文体质量,有时反而会因引入过多的迟疑和不必要的细节而降低应该直接呈现的文本质量。
简单问答 :答案要么在上下文中,要么不在——信息检索任务。
2025 年发表的研究为多模态任务增加了一个更令人警醒的数据点:在视觉场景中,更长的推理链与幻觉的增加呈正相关。机制是注意力漂移——随着推理的延伸,模型越来越依赖语言先验,而非实际图像。扩展思考不仅无法帮助视觉感知任务,反而会造成伤害。
实用的判断标准:如果输出质量取决于中间推理步骤是否正确,扩展思考是候选方案。如果质量取决于检索、格式化或文体,扩展思考就是浪费——甚至有害。
预算设置:从随意到精准
大多数工程师在开始使用扩展思考时,会挑一个整数(16K、32K、64K token)作为永久设置。这在两个方向上都是在白白浪费钱:对简单任务过度预算,对高难度任务预算不足。
关于 token 预算感知推理的研究(TALE、SelfBudgeter 及相关框架)汇聚于一个粗略的按复杂度分层的建议:
简单推理 (直接逻辑、单领域分析):2K-4K token 已足够。额外预算不会提升准确度。
中等复杂度 (多步骤数学、有明确失败症状的代码调试):8K-12K token。
高难度问题 (竞赛数学、大型代码库的架构审查、法律文件综合):16K-32K token。
研究级或新颖问题 :32K-64K token。超过这个量,边际准确率增益急剧下降,而成本持续上升。
一个反直觉的发现:被告知 token 预算的模型往往会低于预算——它们感受到约束并在耗尽预算前压缩推理。这意味着对一个高难度问题设置 16K 预算,可能只会产生 1-1.2 万个 token 的实际推理量,这通常已经足够。约束本身并非瓶颈。
来自生产环境的更实用观察:从一个保守的默认值(8K-10K)开始,监控查询分布中的思考 token 使用情况。如果你持续发现某些查询消耗了 80% 以上的预算,那个群组需要更高的上限。如果某个类别平均只用了 20% 的预算,这些查询要么根本不需要扩展思考,要么足够简单,更低的预算也能胜任。
构建选择性使用思考预算的路由层 发现思考预算决策之后,团队做出的最有效的单一改变是构建一个路由层,避免对不需要扩展思考的任务触发它。架构各有不同,但逻辑结构是一致的。
语义路由 以近乎零的开销处理显而易见的情况。对传入查询进行嵌入,与每个推理类别的标记样例短语进行比较。匹配"总结这个文档"或"分类这个工单"的查询,在调用任何模型之前就路由到标准模式。匹配"解这道方程"或"找这个实现中的 bug"的查询则路由到扩展思考。路由器增加个位数毫秒的延迟,并避免对大多数不需要它的查询调用昂贵的路径。
LLM 辅助路由 处理模糊情况。一个小型快速模型(相当于 o3-mini 或 Claude Haiku)分析传入查询并预测任务需要哪个推理级别。这增加了一个小型推理调用,但能捕获嵌入相似度遗漏的边缘情况——一个最终涉及复杂账单纠纷的客户支持查询,或一个涉及微妙并发 bug 的代码补全请求。
认知决策路由(CDR)方法将此形式化为值得评估的四个维度:给定信息与所需结论之间的相关性强度、需要跨越的领域边界数量、需要调和的利益相关者视角数量,以及任务的不确定程度。跨越领域边界且需要调和矛盾信号的查询需要扩展思考;高相关性的单领域查询则不需要。CDR 实现报告了约 34% 的计算成本降低,同时保持了基准性能。
对大多数团队来说,一个更简单的版本就够用了:首先实施语义路由,正确处理约 80% 的情况,然后手动审查剩余的错路由查询,针对工作负载中特定的模糊模式构建 LLM 辅助路由逻辑。
过度思考问题及如何发现它 即使是拥有良好路由逻辑的团队,也会遇到一种值得命名的失败模式:扩展思考可能产生冗长、过度回避或内部矛盾的答案,这些问题在没有仔细评估的情况下很难发现。模型将大量 token 预算用于不确定性管理——生成复杂的推理链来掩盖潜在的疑虑,而非解决它。
亚马逊科学的"过度思考问题"研究对此做了精确描述:被要求回答简单问题的模型,可能在给出它本可以立即给出的答案之前,生成数百个 token 的推理链。成本是真实的,质量收益却没有。而且因为推理默认是隐藏的,如果没有明确的日志记录,就无法看到 token 级别的追踪。
几个生产实践有所帮助:
记录每个请求的思考 token 使用情况。 大多数 API 在响应元数据中返回这一信息。将其与输出质量指标一起追踪。如果高思考 token 使用量与用户满意度或下游任务成功率的相关性很差,你就有证据表明扩展推理在该查询类别上存在误触发。
将推理质量与输出质量分开评估。 可见答案可以是正确的,而推理链却是冗余或不连贯的。如果你将扩展思考用于高风险决策(医疗分诊、法律分析、财务建模),审计推理链是质量流程的一部分——而不仅仅是输出。
在可用时使用自适应思考。 Claude Opus 4.6+ 和 Sonnet 4.6+ 包含自适应思考,模型根据检测到的复杂度自主决定应用多少内部推理。这将预算决策从你设置的参数转变为每请求动态确定的结果。它不能消除理解思考预算的必要性,但为尚未构建路由基础设施的团队消除了手动分层的开销。
经济决策 从扩展推理模型中获得最高回报的团队,将其作为精准工具而非默认设置来使用。工作流程是:
识别你的任务分布:有多大比例的查询是具有中间正确性要求的结构化推理问题?
将扩展思考保留给这部分查询。将其他一切路由到标准模式。
设置保守的预算上限;监控实际使用情况以进行调整。
按类别记录思考 token 消耗;将意外的峰值视为需要调查的路由故障。
基准测试数字是真实的——扩展思考在高难度推理任务上代表着真正的能力飞跃。但这些收益伴随着在规模化时快速累积的明确成本结构。对所有查询统一启用扩展思考的团队,正在为摘要工作支付 o3 级别的费率,而标准模型可以同样出色地完成这项工作。路由决策不是你以后再添加的优化;它是运行这些模型的基本经济学的一部分。
原则很简单:思考预算是一种资源,资源应分配到能产生价值的地方——而不是因为选项存在就均匀分配。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部