跳到主要内容

1 篇博文 含有标签「small-language-models」

查看所有标签

当往返时延成为 Bug :你一直在忽略的端侧推理必要性

· 阅读需 11 分钟
Tian Pan
Software Engineer

这是一个你应该比现在更关注的数字:在模型生成第一个 token 之前,云端 LLM 端点的中位网络往返延迟在 48 到 800 毫秒之间。这不包括推理时间,也不包括排队时间。这是“走出大楼”的代价——DNS 解析、TLS 握手、往返最近数据中心的传输。对于单次聊天补全,你从未注意到它。但对于一个需要进行九次连续工具调用来回答一个问题的智能体,你刚刚交付了 5 秒钟的纯传输延迟,而你的用户能真切感受到其中的每一点。

大多数团队将往返延迟视为业务的固定成本,认为可以通过流式传输和加载动画来优化。但对于越来越多类型的工作负载来说,往返延迟本身就是 Bug。你需要的模型足够小,完全可以在数据所在地运行;任务足够重复,导致边际云端成本累积成一笔巨款;数据足够敏感,将其发送给第三方是你一直在默默承受的风险。端侧和边缘推理是大多数工程团队会反射性拒绝的选项——“本地模型不够好”——而这种拒绝正变得越来越站不住脚。