跳转到主要内容

你的上下文是有质量的:数据重力与“计算向数据移动”的回归

阅读需 2 分钟Tian PanTian Pan

Hadoop 时代的一代人彻底学会了一个教训,以至于它成了一种本能:移动数据是昂贵的,所以要把计算移动到数据所在的地方。每一个 MapReduce 调度器、每一个 HDFS 块放置决策、每一个“数据本地化”(data locality)仪表盘的存在都是为了服务于这一原则。然后,在托管模型 API 的兴起和智能体(agent)热潮之间的某个时刻,我们悄然颠倒了这一原则——而且没有人重新评估这一决策的成本。

看看现代智能体循环(agent loop)实际上在做什么。它从向量数据库中检索一堆文档,从对象存储中提取代码库快照,从六个内部服务中收集工具执行结果,将所有这些内容拼接进一个上下文窗口,然后将整个负载发送到通常位于不同 VPC、不同区域、甚至不同云平台的模型端点。然后在下一轮对话中重复这一过程。周而复始。你的上下文具有质量,而你正在为每一次跳转支付运费。

这些数字绝非舍入误差。在运行高流量推理负载的组织中,出口流量(egress)费用已经占到云总支出的 10%–25%,而智能体从结构上放大了这个问题:一个智能体消耗的 Token 大约是单次对话的 4 倍,而多智能体系统则约为 15 倍。Token 数量是衡量数据传输量的一个不错指标。每一个 Token 都在某处被组装、序列化,并跨越网络边界进行传输,而这些都是要计费的——即使账单条目上从未写着“AI”字样。

无人估价的“反转”

“计算向数据靠拢”原则并非意识形态,而是算术题。在 2010 年代的 Hadoop 集群中,网络是最稀缺的资源,因此调度器会将每个 map 任务分派到已经持有数据块的节点上。跨交换机流量是你需要优化的故障模式。

托管 LLM API 以一种特殊的方式打破了这种算术平衡:计算变得不可协商。你无法在存储数据的节点上运行顶级模型。GPU 位于提供商放置它们的地方,而接口是一个 HTTPS 端点。因此,行业默认选择了唯一剩下的选项——将数据移动到计算端。由于最初的负载很小(一个提示词,几百个 Token),成本是隐形的。

智能体终结了小负载时代。单个智能体轮次通常携带数兆字节的数据:检索到的片段、文件内容、工具输出以及整个累积的对话历史记录,这些内容在每次迭代中都会被重新发送。对生产环境智能体账单的分析一致发现,重复发送的上下文——而非新输入或输出——是主要的成本项,通常占 Token 总支出的 60% 左右。同样的动态也在网络层上演。曾经是包含小消息的频繁交互协议(chatty protocol),现在变成了包含重负载的频繁交互协议,而“频繁交互且重负载”正是出口流量计费惩罚最严厉的流量模式。

数据重力(Data gravity)—— Dave McCrory 很久以前提出的观点,即大型数据集会吸引应用程序向其靠近——原本是关于供应商锁定(lock-in)的一个警告。对于推理负载而言,它已变成了一个字面意义上的成本函数:你的上下文来源距离模型端点越远,每一个智能体轮次的“重量”就越大。

单个智能体轮次中的计费边界

追踪生产环境中智能体的一个轮次并计算上下文跨越的边界会有所帮助。一个典型的企业级 RAG 加工具(RAG-plus-tools)循环如下所示:

  • 向量数据库到编排器。 检索返回 20–50 个片段。如果你的向量数据库是另一个 VPC 或区域中的托管服务,这一跳转在他们那边计收出口流量费,而在你这边可能计收入口处理费。
  • 对象存储到编排器。 智能体读取文件——代码库快照、PDF、电子表格。S3 到同区域的 EC2 是免费的;S3 到另一个区域或另一个云平台的费用为每 GB 0.02–0.09 美元。
  • 内部服务到编排器。 工具调用扇出到各个微服务。在 AWS 上,每个跨可用区(AZ)的跳转双向各需 0.01 美元/GB,而高可用架构在设计上就是跨可用区的。
  • 编排器到模型端点。 组装好的上下文——对话中期通常达到 50,000–200,000 个 Token——被发送到推理提供商。跨云传输时,这将按互联网出口流量的全额费率计费,第一级定价约为 0.09 美元/GB。
  • 每轮重复。 一个包含 20 轮对话的智能体会话会重新跨越这些边界 20 次,且随着历史记录的累积,负载在每一轮都会增加。

你的模型提供商发票中不会出现这些跳转费用。Token 定价是可见的成本;而“运费”则散落在云账单中的“数据传输”项下,没有人会将其归因于 AI 项目。那些正确测量这些成本的团队往往会发现,每个智能体会话的实际成本明显高于 Token 计算出的预期——而这一差距几乎完全是由地理位置决定的。

会员专享

余下内容仅对会员开放。

会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。

  • 完整文章,包含未公开存档的部分
  • 可落地的工作框架,附带权衡与决策依据
  • 新文章抢先看,先于公开发布

随时取消 · 一次订阅,畅读全部

参考资料

保持联系,关注我获取更多内容

阅读需 11 分钟

内部容量市场:在团队间分配稀缺的推理资源

当多个团队共享同一个推理池时,一个团队的评估扫描(Eval Sweep)可能会使另一个团队的生产环境对话系统陷入饥饿。借鉴大型机分时系统和 Borg 的优先级波段:本文将探讨优先级层级、抢占、费用回填,以及团队在何时应当获得专用容量。

insider
ai-agents
阅读需 9 分钟

你的智能体是一个“话唠”客户端:数据引力开始影响工具循环

AI 智能体在处理每个任务时会进行数十次串行工具调用。当推理和数据位于不同的云端时,延迟和出站流量费用将成为主要成本。N+1 查询问题又回来了 —— 只是上升了一个层级。

ai-agents
infrastructure
阅读需 10 分钟

间接提示注入:你以为处于惰性的数据平面

你的智能体将检索到的每个文档都视为惰性数据,但检索到的文本实际上是以系统提示词的权限运行的。本文将探讨间接提示注入的工作原理、为什么 EchoLeak 证明了它的存在,以及真正有效的防御手段。

insider
ai-security
阅读需 9 分钟

向量索引存在一个没人定义的陈旧度 SLO

每晚进行的重新索引任务是一个没人写下来的新鲜度承诺。本文介绍如何将向量索引延迟转化为可衡量的 SLO,向智能体和用户展示数据账龄,并根据衰减率而非习惯进行重新索引。

insider
rag
阅读需 8 分钟

上下文填充反模式:为什么更多的上下文反而会让 LLM 变差

将完整文档、原始工具输出和长聊天历史直接塞进 LLM 上下文窗口是一个可靠性陷阱。本文将介绍如何检测上下文何时在损害你的系统 — 以及如何通过具备预算意识的策展模式来修复它。

insider
llm