·tian
当往返时延成为 Bug :你一直在忽略的端侧推理必要性
延迟、成本和隐私的考量正在悄然转向,反对云端往返 —— 以及决定每个查询实际运行位置的单次请求路由模式。
edge-inference
on-device-ai
latency
ai-engineering
+1·tian
端侧 AI 需要的是机群管理器,而非模型卡片
为每个用户推送相同的端侧模型,意味着你要么在旗舰机上空耗电池,要么在长尾设备上交付降级的产品。解决这一问题的工程准则更像是一个 CDN,而不是模型注册表。
insider
on-device-ai
mobile-ml
edge-ai
+2·tian
边缘 LLM 推理:当延迟、隐私或成本迫使你离开云端
一个在单 GPU 上微调的 7B 模型可以在特定领域以零边际 token 成本击败 GPT-4。关于硬件选型、量化格式、混合本地-云端路由以及使边缘 LLM 推理达到生产级别的部署框架的实用指南。
edge-ai
llm-inference
quantization
on-device-ai
+1·tian
混合云边 LLM 推理:端侧模型何时优于云端
生产团队正将 60–80% 的 LLM 查询路由到端侧模型——将延迟降低到 20 ms 以下,消除了数据驻留的烦恼,并大幅削减了云端推理成本。这是一份关于混合云边推理背后的路由、压缩和架构模式的实用指南。
edge-ai
llm-inference
on-device-ai
model-compression