·tian
内部容量市场:在团队间分配稀缺的推理资源
当多个团队共享同一个推理池时,一个团队的评估扫描(Eval Sweep)可能会使另一个团队的生产环境对话系统陷入饥饿。借鉴大型机分时系统和 Borg 的优先级波段:本文将探讨优先级层级、抢占、费用回填,以及团队在何时应当获得专用容量。
insider
ai-agents
infrastructure
cloud-costs
+1·tian
你的智能体是一个“话唠”客户端:数据引力开始影响工具循环
AI 智能体在处理每个任务时会进行数十次串行工具调用。当推理和数据位于不同的云端时,延迟和出站流量费用将成为主要成本。N+1 查询问题又回来了 —— 只是上升了一个层级。
ai-agents
infrastructure
cloud-costs
llm
·tian
你的上下文是有质量的:数据重力与“计算向数据移动”的回归
Agent 循环在每一轮都会跨越 VPC 和云边界传输数 MB 的上下文,而这笔运费从未出现在模型账单上。为什么 Hadoop 时代的“计算向数据移动”原则正在回归,以及如何审计你推理栈的重力。
insider
ai-agents
infrastructure
cloud-costs
+1