你的上下文是有质量的:数据重力与“计算向数据移动”的回归
Hadoop 时代的一代人彻底学会了一个教训,以至于它成了一种本能:移动数据是昂贵的,所以要把计算移动到数据所在的地方。每一个 MapReduce 调度器、每一个 HDFS 块放置决策、每一个“数据本地化”(data locality)仪表盘的存在都是为了服务于这一原则。然后,在托管模型 API 的兴起和智能体(agent)热潮之间的某个时刻,我们悄然颠倒了这一原则——而且没有人重新评估这一决策的成本。
看看现代智能体循环(agent loop)实际上在做什么。它从向量数据库中检索一堆文档,从对象存储中提取代码库快照,从六个内部服务中收集工具执行结果,将所有这些内容拼接进一个上下文窗口,然后将整个负载发送到通常位于不同 VPC、不同区域、甚至不同云平台的模型端点。然后在下一轮对话中重复这一过程。周而复始。你的上下文具有质量,而你正在为每一次跳转支付运费。
这些数字绝非舍入误差。在运行高流量推理负载的组织中,出口流量(egress)费用已经占到云总支出的 10%–25%,而智能体从结构上放大了这个问题:一个智能体消耗的 Token 大约是单次对话的 4 倍,而多智能体系统则约为 15 倍。Token 数量是衡量数据传输量的一个不错指标。每一个 Token 都在某处被组装、序列化,并跨越网络边界进行传输,而这些都是要计费的——即使账单条目上从未写着“AI”字样。
无人估价的“反转”
“计算向数据靠拢”原则并非意识形态,而是算术题。在 2010 年代的 Hadoop 集群中,网络是最稀缺的资源,因此调度器会将每个 map 任务分派到已经持有数据块的节点上。跨交换机流量是你需要优化的故障模式。
托管 LLM API 以一种特殊的方式打破了这种算术平衡:计算变得不可协商。你无法在存储数据的节点上运行顶级模型。GPU 位于提供商放置它们的地方,而接口是一个 HTTPS 端点。因此,行业默认选择了唯一剩下的选项——将数据移动到计算端。由于最初的负载很小(一个提示词,几百个 Token),成本是隐形的。
智能体终结了小负载时代。单个智能体轮次通常携带数兆字节的数据:检索到的片段、文件内容、工具输出以及整个累积的对话历史记录,这些内容在每次迭代中都会被重新发送。对生产环境智能体账单的分析一致发现,重复发送的上下文——而非新输入或输出——是主要的成本项,通常占 Token 总支出的 60% 左右。同样的动态也在网络层上演。曾经是包含小消息的频繁交互协议(chatty protocol),现在变成了包含重负载的频繁交互协议,而“频繁交互且重负载”正是出口流量计费惩罚最严厉的流量模式。
数据重力(Data gravity)—— Dave McCrory 很久以前提出的观点,即大型数据集会吸引应用程序向其靠近——原本是关于供应商锁定(lock-in)的一个警告。对于推理负载而言,它已变成了一个字面意义上的成本函数:你的上下文来源距离模型端点越远,每一个智能体轮次的“重量”就越大。
单个智能体轮次中的计费边界
追踪生产环境中智能体的一个轮次并计算上下文跨越的边界会有所帮助。一个典型的企业级 RAG 加工具(RAG-plus-tools)循环如下所示:
- 向量数据库到编排器。 检索返回 20–50 个片段。如果你的向量数据库是另一个 VPC 或区域中的托管服务,这一跳转在他们那边计收出口流量费,而在你这边可能计收入口处理费。
- 对象存储到编排器。 智能体读取文件——代码库快照、PDF、电子表格。S3 到同区域的 EC2 是免费的;S3 到另一个区域或另一个云平台的费用为每 GB 0.02–0.09 美元。
- 内部服务到编排器。 工具调用扇出到各个微服务。在 AWS 上,每个跨可用区(AZ)的跳转双向各需 0.01 美元/GB,而高可用架构在设计上就是跨可用区的。
- 编排器到模型端点。 组装好的上下文——对话中期通常达到 50,000–200,000 个 Token——被发送到推理提供商。跨云传输时,这将按互联网出口流量的全额费率计费,第一级定价约为 0.09 美元/GB。
- 每轮重复。 一个包含 20 轮对话的智能体会话会重新跨越这些边界 20 次,且随着历史记录的累积,负载在每一轮都会增加。
你的模型提供商发票中不会出现这些跳转费用。Token 定价是可见的成本;而“运费”则散落在云账单中的“数据传输”项下,没有人会将其归因于 AI 项目。那些正确测量这些成本的团队往往会发现,每个智能体会话的实际成本明显高于 Token 计算出的预期——而这一差距几乎完全是由地理位置决定的。
- https://www.suse.com/c/the-data-gravity-problem-moving-data-to-ai-vs-moving-ai-to-data/
- https://blog.purestorage.com/purely-technical/the-economics-of-data-gravity/
- https://dev.to/ntctech/ai-inference-is-the-new-egress-the-cost-layer-nobody-modeled-2kcp
- https://cast.ai/blog/data-egress-cost-how-to-take-back-control-and-reduce-egress-charges/
- https://www.nops.io/blog/aws-egress-costs-and-how-to-avoid/
- https://data-flair.training/blogs/data-locality-in-hadoop-mapreduce/
- https://www.thoughtworks.com/insights/decoder/d/data-locality
- https://getunblocked.com/blog/agent-auto-loop-token-cost/
- https://www.augmentcode.com/guides/ai-agent-loop-token-cost-context-constraints
- https://arxiv.org/pdf/2503.14649
