跳到主要内容

当往返时延成为 Bug :你一直在忽略的端侧推理必要性

· 阅读需 11 分钟
Tian Pan
Software Engineer

这是一个你应该比现在更关注的数字:在模型生成第一个 token 之前,云端 LLM 端点的中位网络往返延迟在 48 到 800 毫秒之间。这不包括推理时间,也不包括排队时间。这是“走出大楼”的代价——DNS 解析、TLS 握手、往返最近数据中心的传输。对于单次聊天补全,你从未注意到它。但对于一个需要进行九次连续工具调用来回答一个问题的智能体,你刚刚交付了 5 秒钟的纯传输延迟,而你的用户能真切感受到其中的每一点。

大多数团队将往返延迟视为业务的固定成本,认为可以通过流式传输和加载动画来优化。但对于越来越多类型的工作负载来说,往返延迟本身就是 Bug。你需要的模型足够小,完全可以在数据所在地运行;任务足够重复,导致边际云端成本累积成一笔巨款;数据足够敏感,将其发送给第三方是你一直在默默承受的风险。端侧和边缘推理是大多数工程团队会反射性拒绝的选项——“本地模型不够好”——而这种拒绝正变得越来越站不住脚。

这并非是在推崇“所有东西都本地化”的纯粹主义。我的观点是,每次调用 API 时,你其实都在做一个路由决策,而且是默认做的,但这个默认选项已不再是显而易见的正确选择。有趣的设计空间在于两者之间的光谱,每个请求都应被放置在延迟-成本-隐私这一多维平面上的正确点位。

没人计算过的延迟账

云端延迟基准测试确实变得越来越好。截至 2026 年中期,最快的托管模型——Gemini Flash、Claude Haiku 4.5——在处理中等长度的提示词时,首个 token 的生成时间 (TTFT) 能稳定控制在 600 毫秒以内。这令人印象深刻,对于单次面向用户的补全来说,速度已经绰绰有余。

问题在于,大多数生产环境中的 AI 不再是单次补全。它是一个链条。智能体进行推理、调用工具、读取结果、再次推理、调用另一个工具。每一次跳转都要重新支付往返延迟。如果你的网络传输本身就是 300 毫秒,而你的智能体平均每个任务有八次模型调用,那么在计算第一个生成的 token 之前,你已经在传输上花费了 2.4 秒。流式传输只能隐藏最后一次调用的首字等待时间;它对之前的七次连续往返延迟无能为力。

端侧推理颠覆了这个等式。在像 Jetson AGX 这样的边缘加速器上,7B 模型的实测首字生成时间约为 0.28 秒——这比 GPT-4 级别的云端 TTFT (约 0.71 秒) 还快——因为路径中完全没有网络。在现代手机的 NPU 上,通过 Hexagon 级别的加速器,3B 模型运行速度约为每秒 48 个 token;生产环境中的混合部署报告称,对于可路由的那部分流量,端侧响应时间低于 20 毫秒。虽然 token 生成吞吐量通常低于数据中心 GPU,但对于简短的结构化输出——分类、提取、路由决策——实际总耗时更胜一筹,因为你省去了“通勤时间”。

诚实的对立观点是:本地硬件的吞吐量确实存在且不均衡。在普通笔记本电脑 CPU 上运行 14B 模型,速度只有每秒 4–8 个 token,对于任何长篇内容来说都很痛苦。Apple Silicon 的统一内存是个例外,在让 PC CPU 窒息的同一个模型上,它能达到每秒 45–120 个 token。因此,延迟优势取决于工作负载的形状:对于短促、频繁、连续的调用,它是决定性的;而对于原始吞吐量占主导地位的长篇单次生成,这种优势就会消失。

反转的成本曲线

云端推理定价在单次调用时看起来很便宜,但在规模化时却代价高昂。云端 API 请求的边际成本永远不会归零——每一次推理都在计费,永无止境。边缘设备则呈现相反的形态:前期是固定的硬件成本,而单次推理的边际成本几乎可以忽略不计。

一旦你衡量的是能量而非标价,单次查询的数字就变得触目惊心。按每度电 0.25 美元计算,一个 GPT-4 级别的云端响应在计算等效能耗上约为 1.65 美分;而在 Jetson AGX 边缘设备上完成同样任务的成本约为 0.004 美分,在更小的 Jetson Nano 上约为 0.0017 美分。对于小模型能处理的工作负载,单次查询的成本差异高达 400–1000 倍。将小语言模型部署于高频重复任务(如支持工单分类、文档字段提取、代码评审分流)的团队报告称,与将同样流量路由到托管的尖端模型相比,总成本降低了 4 倍甚至更多。

关键在于“重复”二字。只有当你有足够的量来摊销硬件成本,且任务能容忍较小的模型时,边缘经济学才奏效。在云端,4B 级模型每百万次请求的成本约为 72 美元;而同样百万次请求,尖端模型可能耗资数千美元。如果你 70% 的流量是 4B 模型能以 90% 的尖端模型质量处理的任务,那你就是在为商品级工作支付尖端价格。这个差距就是套利空间,而大多数团队都错失了这一机会,因为将所有内容路由到一个大模型在操作上更简单。

隐私不再只是一个复选框

对于受监管的数据——健康记录、金融交易,以及任何受数据驻留规则约束的内容——云端往返不仅是延迟成本,更是一个合规事件。每一条离开你边界的请求都是一次数据外流 (data egress),法务人员必须对此进行评估,它是你数据处理协议 (DPA) 中的第三方子处理器,也是你下一次审计中的一个条目。

端侧推理完全消除了这个问题。如果推理发生在用户的手机上或你的 VPC 内部,就不会有数据外流,没有子处理器,也没有驻留合规担忧,因为数据从未移动过。这就是为什么边缘推理最强大的早期采用者不是痴迷于延迟的游戏公司,而是医院、银行,以及任何数据分类让“发送到外部 API”变成一个长达数季度审批流程的机构。

团队常搞错的一个架构细节是:隐私驱动的混合系统必须故障关闭 (fail closed),而不是故障开启 (fail open)。如果一个请求被标记为敏感,而本地模型无法处理它,正确的行为是返回错误,而不是为了“就这一次”而悄悄路由到云端。在高负载下静默地将敏感数据发送给第三方的回退方案比没有回退方案更糟糕,因为它在测试中表现良好,却在你最忙碌的时候破坏了你的合规态势。路由层必须将数据敏感性视为硬约束,而非偏好。

量化让这一切成为现实

两年前这一切都行不通,因为能适配边缘硬件的模型太弱,无法发挥作用。情况发生了变化,而杠杆就是量化。将权重从 16 位浮点数降至 INT8 或 INT4,可以在保留 90–97% 准确率的同时,将模型缩小 2–4 倍——在具有原生 INT4 支持的硬件上,INT4 的推理速度比全精度快达 4 倍左右。准确率损失是真实存在的,但也是有限的:INT8 大约下降 1–3%,INT4 下降 5–10%,这对于边缘部署最初瞄准的结构化、垂直任务来说是可以接受的。

将量化与任务专门化结合,质量差距就会消失。一个通用的 1.5B 模型在数学基准测试中得分约为 60%;而一个针对数学微调过的专门化 1.5B 模型得分能达到 91%——在仅占用五分之一资源的情况下,达到了通用 7B 模型的水平。教训是,“小模型”和“弱模型”不再是同义词。一个专注于窄任务的小模型通常能击败一个面面俱到的巨大通用模型,而且它能装进你的口袋。

这是让路由决策变得有趣的关键。你不再是在“优秀的云端模型”和“无用的本地模型”之间做选择,而是在一个需要花钱且有往返延迟的前沿通用模型,与一个在其涵盖的工作范围内免费、即时且私密的专门化本地模型之间做选择。

路由层才是真正的产品

如果端侧推理在各方面都绝对优于云端,那么这就是一个迁移故事。但事实并非如此——这是一个路由故事。对于严肃的团队来说,最终状态是一个包含多种推理环境(设备端、私有化部署、边缘集群、云端 GPU)的光谱,并配有一个智能层,将每个查询放置在延迟-成本-隐私平衡点上的最优位置。你进行路由的信号包括:

  • 数据敏感性 — 敏感载荷保留在本地并故障关闭;其他内容可以考虑云端。
  • 任务复杂度 — 置信度或难度估计决定了是由本地模型尝试任务还是升级处理。新颖、多步骤或低置信度的查询上云;常规查询留在本地。
  • 延迟预算 — 交互式、顺序式或具备离线能力的路径倾向于本地;批处理或单次生成可以忍受往返延迟。
  • 当前负载 — 当边缘端设备群出现突发流量时,负载感知的设备选择比幼稚的分配方案能减少 30–40% 的云端溢出。

这种方案的幼稚版本是手动调整阈值:“如果 Prompt 低于 N 个 token 且未标记为敏感,则在本地运行。” 这行得通,也是每个人都应该开始的地方。前沿领域正在用学习型路由器取代这些静态规则——即根据实时成本、延迟和质量反馈优化单次请求放置的上下文多臂老虎机 (contextual bandits)。主要的消费级巨头已经在应用这一技术:一个混合本地-服务器的编排器,它会在不询问用户的情况下,根据每个任务决定是由手机还是云端来回答。路由智能,而非模型本身,正在成为具备防御性的核心。

周一具体该做什么

你不需要重构你的技术栈。你需要停止将云端往返视为免费,并开始将其作为一项支出进行衡量。

首先对你现有的流量进行监测。按 token 长度、任务类型和数据敏感性对请求进行分桶,你几乎肯定会发现大量简短、重复、非敏感的调用——分类、提取、路由决策、简单的改写——量化后的小模型可以在本地以极低的成本和延迟处理这些请求。那个桶就是你的试点项目。

然后构建最简单的路由器:一个敏感性标志和一个 token 长度阈值,线以下的用本地模型,线以上的用云端,对于本地模型无法处理的任何敏感内容则执行故障关闭。针对一个工作负载发布它,测量延迟和成本的变化,让数据告诉你是否要提高阈值。在这方面取得成功的团队并没有把公司押注在本地推理上——他们只是注意到云端往返悄然成为了流水线中最昂贵的部分,并在不必要的地方停止支付这笔费用。

References:Let's stay in touch and Follow me for more thoughts and updates