租赁智能:CFO 的 LLM 支出心理模型
大多数财务团队都把第一张 LLM 账单放错了地方。它出现在实验阶段,当时只有少数工程师正在使用 API 密钥进行原型设计,它看起来确实就是当时的样子:研发支出 (R&D)。每月花费几千美元来弄清楚这项技术是否可行。因此,无论是在认知上还是在实际操作中,它都被归入了研发支出,没有人对此深究。
随后,功能上线,使用量攀升,第一季度还是可以忽略不计的误差项,到了第四季度就变成了云服务账单中增长最快的成本。问题从来不在于金额大小。问题在于成本已经悄然改变了类别——从对构建某项功能的固定投入,变成了服务每一位用户的变动成本——而思维模型却没有随之转变。
这种分类错误是目前 AI 产品中最昂贵的会计错误,而且它本质上甚至不是会计错误,而是预测错误。
那些被打得措手不及的公司,并不是因为花钱太多,而是因为他们将一个随使用量规模化的成本当成了固定成本,并基于这一假设为产品定价,直到收到账单时才发现其中的差距。OpenAI 本身就是一个大规模的警示案例:2025 年其预计营收为 37 亿美元,亏损约 50 亿美元,每赚 1 美元就要 支出约 1.35 美元——这并非由员工人数或模型训练驱动,而是由为数十亿次请求提供推理服务的原始成本驱动。你不需要达到那样的规模就能感受到这种动态带来的压力。你只需要判断错你所承担的成本类型。
Token 是 COGS,而非研发支出
最清晰的思维模型是最古老的那个:像制造商一样思考,而不是像软件公司。
传统 SaaS 拥有 80% 以上的高毛利,是因为每增加一名客户的边际成本几乎为零。你只需编写一次软件,然后售卖一百万次。成本结构几乎完全是固定的——工程师工资、固定的云服务账单——收入在增长的同时,成本几乎不动。这就是软件成为一门如此美妙的生意的原因。
推理打破了这一规律。每一次查询都要重新运行模型。每一次模型运行都会消耗 GPU 计算、内存带宽和能源,而这些都是需要付费的。这里没有“构建一次,无限销售”的诀窍,因为每一笔交易都带有真实的变动成本。这使得 Token 支出成为了真正意义上的主营业务成本 (COGS) —— 它与使用量挂钩,而非与用户量挂钩。它随着 Prompt 长度、响应长度、重试次数和并发量的增加而上升。即使在考虑到缓存和批量折扣后,下一次请求的边际成本也永远不会为零。
数据反映了这一转变。ICONIQ 的 2026 年数据显示,AI 产品的平均毛利率为 52% —— 高于 2024 年的 41%,但仍与定义了成熟 SaaS 的 80% 标杆相去甚远。在处于规模化阶段的 AI B2B 公司中,仅推理一项就消耗了大约 23% 的收入。披露 AI 驱动的利润压力的上市公司报告称,其毛利率比 AI 之前的基准线低了 10 到 17 个百分点。当你的收入有四分之一被一个随着每次成功的客户交互而增长的成本吃掉时,这个成本应该放在毛利率线上方,并像对待 COGS 一样进行建模和监控。
实际后果是:如果你的 Token 支出在损益表 (P&L) 中被列为研发支出,你的毛利率看起来会比实际情况更好,你就会一直根据一个虚假的数据来做出定价和增长决策。
什么时候租用是明智的交易
将其称为 COGS 并不意味着它是一个需要消除的问题。按 Token 付费的全部意义在于,你在租用智能而不是购买智能,而租用通常是正确的财务决策。
当你调用供应商的 API 时,你无需承担资本支出 (capex),无需采购 GPU,没有折旧计划,也没有闲置产能的风险。你只为你使用的部分付费,当使用量归零时,成本也会降至零。对于一个仍在成型中的产品——需求不确定、工作负载在演变、模型格局每季度都在重新洗牌——这种选择权价值巨大。你是在购买以低廉成本改变主意的权利。在了解你要制造什么之前就投入自有基础设施以降低每 Token 费率,等同于在不知道要生产什么之前就买下一座工厂。
租用模式中还隐藏着第二个礼物:你所租用的东西的价格正在持续崩塌。在两年内,实现同等能力水平的成本下降了约 280 倍——从 GPT-3.5 级别性能的每百万 Token 约 20 美元,降至约 7 美分。目前各模型之间的 API 定价跨度达 600 倍,从最廉价的每百万 Token 一角钱,到最尖端推理模型的 60 美元。一个在 18 个月前还不经济的工作负载,今天可能不需要你修改一行代码就能获得丰厚的利润。固定基础设施的所有者无法免费获得这种通缩红利,而租用者可以。
因此,这个框架的真实版本不是“变动成本坏,固定成本好”。而是:在工作负载不确定且技术处于变动期时选择租用,只有当使用量变得庞大且稳定,以至于自有设备的单位节省能够抵消运营成本时,才重新考虑。在实践中总结出的经验法则是,公司在每月推理支出达到 5 万至 10 万美元区间之前,通常会一直使用 API,然后才开始评估专用容量或自托管能力。在这一界限之下,租用溢价要比摆脱它所需的工程成本更便宜。
- https://www.drivetrain.ai/post/unit-economics-of-ai-saas-companies-cfo-guide-for-managing-token-based-costs-and-margins
- https://www.thesaascfo.com/what-should-be-included-in-ai-cogs/
- https://www.saasmag.com/ai-cogs-saas-gross-margin-compression/
- https://fortune.com/2026/06/17/why-is-ai-spending-increasing-as-tokens-get-cheaper-jevons-paradox/
- https://www.navyaai.com/reports/ai-cost-report-token-prices-vs-ai-bill
- https://usagebox.com/articles/flat-rate-ai-pricing-ending-2026
- https://www.mindstudio.ai/blog/usage-based-ai-pricing-vs-flat-subscriptions
- https://www.cloudzero.com/blog/llm-api-pricing-comparison/
- https://www.spheron.network/blog/ai-inference-cost-economics-2026/
