跳转到主要内容

租赁智能:CFO 的 LLM 支出心理模型

阅读需 2 分钟Tian PanTian Pan

大多数财务团队都把第一张 LLM 账单放错了地方。它出现在实验阶段,当时只有少数工程师正在使用 API 密钥进行原型设计,它看起来确实就是当时的样子:研发支出 (R&D)。每月花费几千美元来弄清楚这项技术是否可行。因此,无论是在认知上还是在实际操作中,它都被归入了研发支出,没有人对此深究。

随后,功能上线,使用量攀升,第一季度还是可以忽略不计的误差项,到了第四季度就变成了云服务账单中增长最快的成本。问题从来不在于金额大小。问题在于成本已经悄然改变了类别——从对构建某项功能的固定投入,变成了服务每一位用户的变动成本——而思维模型却没有随之转变。

这种分类错误是目前 AI 产品中最昂贵的会计错误,而且它本质上甚至不是会计错误,而是预测错误。

那些被打得措手不及的公司,并不是因为花钱太多,而是因为他们将一个随使用量规模化的成本当成了固定成本,并基于这一假设为产品定价,直到收到账单时才发现其中的差距。OpenAI 本身就是一个大规模的警示案例:2025 年其预计营收为 37 亿美元,亏损约 50 亿美元,每赚 1 美元就要支出约 1.35 美元——这并非由员工人数或模型训练驱动,而是由为数十亿次请求提供推理服务的原始成本驱动。你不需要达到那样的规模就能感受到这种动态带来的压力。你只需要判断错你所承担的成本类型。

Token 是 COGS,而非研发支出

最清晰的思维模型是最古老的那个:像制造商一样思考,而不是像软件公司。

传统 SaaS 拥有 80% 以上的高毛利,是因为每增加一名客户的边际成本几乎为零。你只需编写一次软件,然后售卖一百万次。成本结构几乎完全是固定的——工程师工资、固定的云服务账单——收入在增长的同时,成本几乎不动。这就是软件成为一门如此美妙的生意的原因。

推理打破了这一规律。每一次查询都要重新运行模型。每一次模型运行都会消耗 GPU 计算、内存带宽和能源,而这些都是需要付费的。这里没有“构建一次,无限销售”的诀窍,因为每一笔交易都带有真实的变动成本。这使得 Token 支出成为了真正意义上的主营业务成本 (COGS) —— 它与使用量挂钩,而非与用户量挂钩。它随着 Prompt 长度、响应长度、重试次数和并发量的增加而上升。即使在考虑到缓存和批量折扣后,下一次请求的边际成本也永远不会为零。

数据反映了这一转变。ICONIQ 的 2026 年数据显示,AI 产品的平均毛利率为 52% —— 高于 2024 年的 41%,但仍与定义了成熟 SaaS 的 80% 标杆相去甚远。在处于规模化阶段的 AI B2B 公司中,仅推理一项就消耗了大约 23% 的收入。披露 AI 驱动的利润压力的上市公司报告称,其毛利率比 AI 之前的基准线低了 10 到 17 个百分点。当你的收入有四分之一被一个随着每次成功的客户交互而增长的成本吃掉时,这个成本应该放在毛利率线上方,并像对待 COGS 一样进行建模和监控。

实际后果是:如果你的 Token 支出在损益表 (P&L) 中被列为研发支出,你的毛利率看起来会比实际情况更好,你就会一直根据一个虚假的数据来做出定价和增长决策。

什么时候租用是明智的交易

将其称为 COGS 并不意味着它是一个需要消除的问题。按 Token 付费的全部意义在于,你在租用智能而不是购买智能,而租用通常是正确的财务决策。

当你调用供应商的 API 时,你无需承担资本支出 (capex),无需采购 GPU,没有折旧计划,也没有闲置产能的风险。你只为你使用的部分付费,当使用量归零时,成本也会降至零。对于一个仍在成型中的产品——需求不确定、工作负载在演变、模型格局每季度都在重新洗牌——这种选择权价值巨大。你是在购买以低廉成本改变主意的权利。在了解你要制造什么之前就投入自有基础设施以降低每 Token 费率,等同于在不知道要生产什么之前就买下一座工厂。

租用模式中还隐藏着第二个礼物:你所租用的东西的价格正在持续崩塌。在两年内,实现同等能力水平的成本下降了约 280 倍——从 GPT-3.5 级别性能的每百万 Token 约 20 美元,降至约 7 美分。目前各模型之间的 API 定价跨度达 600 倍,从最廉价的每百万 Token 一角钱,到最尖端推理模型的 60 美元。一个在 18 个月前还不经济的工作负载,今天可能不需要你修改一行代码就能获得丰厚的利润。固定基础设施的所有者无法免费获得这种通缩红利,而租用者可以。

因此,这个框架的真实版本不是“变动成本坏,固定成本好”。而是:在工作负载不确定且技术处于变动期时选择租用,只有当使用量变得庞大且稳定,以至于自有设备的单位节省能够抵消运营成本时,才重新考虑。在实践中总结出的经验法则是,公司在每月推理支出达到 5 万至 10 万美元区间之前,通常会一直使用 API,然后才开始评估专用容量或自托管能力。在这一界限之下,租用溢价要比摆脱它所需的工程成本更便宜。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 8 分钟

对话的平方成本:为什么 AI 聊天支出呈超线性增长

一次 10 轮的对话成本大约是单轮对话的 55 倍,而非 10 倍,因为每一轮都会对整个历史记录重新计费。本文将分析 N 平方背后的数学原理、为什么缓存无法彻底解决问题以及如何对其进行限制。

llm
cost-optimization
阅读需 10 分钟

自我批判税:让模型检查自己的工作如何导致成本翻倍却收益甚微

Self-Refine、验证链(Chain-of-Verification)和反思提示词在基准测试中承诺了巨大的质量提升 —— 但在生产环境中,它们会使成本增加三倍,导致延迟激增,而实际收益却远低于宣传水平。本文将教你如何在上线前评估这项 “自我批判税”。

insider
llm
阅读需 10 分钟

AI 功能回报期:让财务团队不再质疑的 ROI 模型

传统 ROI 电子表格无法适用于 AI 功能。本文提供一套工程和财务团队都能接受的成本拆解与回报模型。

insider
ai
阅读需 10 分钟

工具边界处的推理模型税

推理模型在基准测试中获胜,但在工具选择步骤中却损失了延迟和质量。本文探讨了按步骤进行的混合路由模式、归因以及反模式。

insider
ai-agents
阅读需 9 分钟

推理模型经济学:思维链何时物有所值

深度思考模型的单次查询成本高出 10–50 倍。本文提供了一套任务分类法,告诉你何时这笔溢价是值得的,以及如何构建自动应用该策略的路由架构。

insider
llm