一个团队发布了一款面向用户的 AI 助手。他们将其定价为每席位每月 49 美元,根据一份假设“每次查询平均 500 个 token”的电子表格,目标毛利率为 70%。三个月后,财务部门指出,他们的重度用户在每个会话中消耗了 15,000 个 token。定价模型之所以崩溃,并不是因为功能失败,而是因为产品团队为他们尚不了解的东西定了价。
这并非预测失败。这是一个结构性问题:大模型驱动产品的成本基准与传统 SaaS 定价所设计的处理方式根本不同。每一次 API 调用都有不可预测且实质性的 token 成本。输入因用户、任务和时间段而异。输出以各种方式复合增长,而这些影响直到几周后才会出现在你的云账单上。一旦你引入了智能体模式 (Agentic patterns) —— 工具调用、多轮推理、子智能体编排 —— 单次用户交互的成本可能是 0.02 美元,也可能是 20 美元,这完全取决于模型的决定。
为什么按席位和按查询定价都会失效
传统 SaaS 的利润模型建立在两个假设之上:边际成本在规模化后趋近于零,且每个用户消耗的产品量大致相同。这两点在 AI API 中都失效了。
按席位定价失效是因为 token 消耗呈幂律分布 (power-law distributed)。根据使用模式的不同,一个每月 10,000 美元的企业席位可能产生 100 美元到 100,000 美元不等的实际 token 成本。平均值作为定价信号是毫无意义的,因为它是由前 5% 的用户驱动的。在健身房会员模式中,重度用户可以很好地补贴轻度用户;但在大模型产品中,一个重度用户就能毁掉你整个群体的利润。
按查询定价失效的原因则相反。两个进行结构化相同 API 调用的客户,可能会因为提示词长度、模型是否调用工具、发生了多少次重试循环,以及你触达的是缓存还是非缓存上下文,而产生 10 倍的 token 成本差异。对成本差异达 100 倍的查询收取相同的费用,要么是一个获客陷阱(补贴昂贵的用户),要么是一个市场退出陷阱(对便宜的用户收费过高)。
更深层次的问题是,这两种模型都不是为了适应可变成本路径而设计的 —— 即在请求完成之前,服务请求的成本是无法预知的。
智能体循环中的 O(N²) 问题
如果按席位和按查询定价对简单的聊天机器人来说已经失效,那么对于由智能体编排多个步骤、工具和模型调用的智能体产品来说,它们会遭遇灾难性的失败。
原因在于上下文累积 (Context compounding)。Transformer 模型在每次推理调用中都要为整个上下文窗口付费,而不仅仅是新生成的 token。在多轮智能体循环中,每一轮都会累积之前所有的上下文作为输入:
- 第 1 轮:4,000 token 系统提示词 + 500 token 用户输入 = 计费 4,500 token
- 第 2 轮:4,000 系统提示词 + 500 输入 + 800 token 先前输出 = 计费 5,300 token
- 第 10 轮:所有先前上下文 + 新输入 ≈ 计费 25,000+ token
总成本遵循 n(n+1)/2 的增长曲线,而不是随轮次线性增长。一个 10 轮的智能体运行成本大约是单次查询的 55 倍,而不是 10 倍。将智能体成本建模为“轮次 × 每轮平均成本”的团队,在第一张生产发票到达之前,通常会低估 3 到 5 倍。
一个拥有 20 页系统提示词并运行 20 轮的智能体,仅在系统提示词重复上就要支付约 80,000 个输入 token。按照目前的顶尖模型定价,在计算模型实际完成的工作之前,仅提示词一项每月的成本就高达数百美元。
这使得你的智能体架构与你的定价模型同样重要。一个允许智能体运行无限制工具调用循环或累积无限上下文的产品,其成本将是无限制且不可预测的。
什么样的定价结构真正有效
行业已经趋向于几种比固定费率模型更能反映成本变动性的模式。
**混合定价(固定基费 + 超量使用费)**目前是大多数人的选择。你收取固定的月度订阅费,涵盖定义的 token 配额,然后对超出该基准的部分按每百万 token 收取超量费用。固定部分为客户提供了可预测的预算底线;超量部分意味着重度用户为其实际消耗付费。需要避免的关键失效模式是将基准配额设得太高,以至于超量收费在理论上可能但在实践中从未触发 —— 这只是重新制造了按席位定价的问题。
信用额度包系统 (Credit bundle systems) 通过将使用量定义为客户预付的“积分”来抽象化每个 token 的复杂性。积分以公布的费率针对不同的模型和功能层级进行兑换。这对于在多个模型之间路由的产品非常有效(积分自然地处理了这种路由,而不会暴露令人困惑的各模型费率),但当客户想要预测成本时表现较差,因为不同供应商和模型世代的积分与 token 比例各不相同。如果你使用积分系统,请公布 token 转换表。
带硬上限的按量计费是最透明的,但也是最令客户感到焦虑的。如果你配合严格的预算控制,纯按量计费是可行的:设置每日或每月的硬性上限,一旦达到限制就拒绝请求,提供实时使用仪表板,并在预算达到 50%、75% 和 90% 时主动发出预警。如果没有这些护栏,按量计费会产生财务团队所谓的“账单突袭风险 (surprise invoice risk)”,无论每 token 的费率多么公平,企业客户都会避而远之。
正确的选择取决于你的客户细分。开发者工具对按量计费的容忍度更高;企业买家需要预算的可预测性,并愿意为此支付溢价。
负载之下崩塌的毛利计算
在收入早期阶段,AI SaaS 产品的毛利率基准看起来健康得具有欺骗性。一个以每百万 token 3 美元的价格购买、并以 30-50% 的加价销售 AI 能力的产品,在电子表格上可以显示出 60-70% 的毛利率。问题在于,这些利润率在你最想留住的客户群体中恰恰会发生侵蚀。
重度企业用户采用 AI 功能的速度比轻度用户更快、更深入。随着他们扩大使用范围——更长的 prompt、更多的 agent 运行、更多的工具调用——他们会进入更高的 token 消耗区间。如果你的定价模型有固定的人头费(per-seat)上限,你就是在收入不变的情况下吸收了这种成本扩张。如果你的定价包含基于用量的组件,重度用户会更频繁地触及上限,并体验到这种摩擦,从而导致你 LTV(生命周期价值)最高的细分市场出现流失。
更持久的利润结构是将成本透明度视为一项功能,而不是隐藏在抽象点数(credits)背后的东西。如果平台能展示每个功能和每个用户的实时 token 成本,就能与客户就使用效率、模型选择和缓存机会进行直接沟通。这种对话将“我的账单比预期的要高”这种对立动态,转变为一种围绕优化的协作关系。
一个经常被忽视的 concrete 杠杆是:在大多数供应商那里,输出 token 的成本是输入 token 的 3-10 倍,但由于上下文的累积效应,大部分总支出其实来自输入。一个缓存了系统提示词(system prompt)和常用上下文的 RAG 应用,可以在不降低输出质量的情况下将每日成本降低 80-90%,因为缓存的输入 token 计费有大幅折扣。那些在基础设施中内置成本优化(Prompt 缓存、针对非实时工作负载的异步批处理、分层模型路由)的团队,比那些将 token 支出视为固定运营支出的团队,能获得 2-5 倍的成本优势。
防御对抗性成本
AI 产品存在一种传统软件中不曾有的失效模式:Prompt 注入攻击和对抗性 prompt 会直接增加你的基础设施成本,而不不仅仅是破坏输出结果。
一个精心设计的 prompt,如果触发了多次工具调用、迫使模型进入长时间的推理循环,或产生多个子 agent 请求,按照尖端模型的定价,单次请求的成本可能达到 5 到 50 美元。在大规模环境下,这要么变成一个拒绝服务(DoS)向量,要么变成一个毛利毁灭场景,具体取决于你是吸收了这笔成本还是将其转嫁给客户。
防御模式主要是架构层面的。对每次 agent 运行的工具调用进行速率限制(Rate limits),可以防止无限循环。对上下文窗口设置请求大小限制,可以防止内存耗尽攻击。特定模型的预算(昂贵模型的单客户限制低于廉价模型)可以对成本最高的代码路径产生自然节流。针对成本激增的异常检测——当任何客户的每日支出比其滚动平均值增加 3 倍时发出警报——可以在对抗场景和合法的用量变化演变成严重问题之前捕捉到它们。
这些在概念上都不是 AI 特有的:它们是任何 API 产品都需要的标准速率限制和异常检测模式。不同之处在于,错过限制所带来的爆炸半径是以“单次请求的美元数”来衡量的,而不只是服务器负载。
沟通比计算更重要
近年来最显眼的 AI 定价失败案例并不是因为底层经济模型错误。一家开发者工具公司宣布了一项“更慷慨”的计划更新,在未声明的情况下取消了之前的请求上限,并将其替换为 20 美元的信用额度(credit limit)。重度用户报告称,在正常使用的三到五个工作日内就耗尽了该限额。这种“挂羊头卖狗肉”的感觉引发了退款请求和客户流失,对公司声誉造成的损害超过了任何单一定价决策所能带来的影响。
这给你的启示并不是“基于用量的定价”是错误的策略。而是 AI 产品的定价变更比传统软件需要更长的预留时间和更高的精确度。“无限访问”和“受 20 美元使用限制约束”是矛盾的信息,客户会记住前者。当你的成本结构发生演变时——无论是供应商提价、你推出了更昂贵的模型,还是你的 agent 功能消耗了更多 token——沟通的时间线比具体的数字更重要。
行业中已经形成的做法是:提前 30-60 天宣布定价变更,并说明具体的单位经济效益(美元或 token,而非抽象的点数),为现有客户提供有文档记录的迁移路径,并在执行前提供宽限期。这会让你损失一个季度的延迟收入回收。但这是值得的,因为替代方案是一个让你在两年后仍不得不为此道歉的公共事件。
为你 18 个月后需要的定价而构建
AI 成本格局的变化速度超出了大多数 SaaS 定价模型的设计承受能力。尖端模型的价格在 2023-2024 年大幅下降,但在最高推理等级上已经稳定或有所增加。开源替代方案在商品化任务上正趋于对等。上下文窗口在三年内从 8K 扩展到 1M token,从根本上改变了长文档处理的经济学。
能够在这场波动中幸存下来的定价架构有一些共同属性。它对客户保持成本透明——使用实际的 token 或美元指标,而不是点数。它将预算控制构建为基础设施,而不是作为支持升级路径。它将模型选择视为一个运行时优化问题,将简单的任务路由到廉价模型,将需要的工作路由到昂贵模型,而不是将所有任务默认分配给最强大(也最昂贵)的模型。
最重要的是,它抵制了将可变成本隐藏在扁平化抽象背后的诱惑。在未来几年表现最好的团队,将是那些弄清楚了如何诚实地与你客户交流 AI 实际成本,并构建出能让这种对话加强而非削弱客户关系产品的团队。
会员专享
余下内容仅对会员开放。
会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
- —完整文章,包含未公开存档的部分
- —可落地的工作框架,附带权衡与决策依据
- —新文章抢先看,先于公开发布
随时取消 · 一次订阅,畅读全部