跳转到主要内容

20 含有标签「llm-inference」

Posts tagged "llm-inference" on TianPan.co.

查看所有标签

·tian

混合云-边缘 LLM 推理:决定成本、延迟和隐私状况的路由层

边缘和云端推理之间的路由层可将 LLM 成本降低 60–80%,同时改善延迟和隐私 —— 本文介绍了查询级路由、模型压缩、投机性解码背后的工程实践,以及使混合架构在生产环境中运行的编排技术。

insider
edge-ai
llm-inference
model-routing
+1
·tian

混合云边 LLM 推理:决定模型运行位置的延迟-隐私-成本“黄金三角”

一份关于在端侧模型与云端 API 之间分配 LLM 推理任务的生产指南 —— 涵盖延迟-隐私-成本三角模型、保持任务精度的压缩技术、智能查询路由,以及混合架构特有的失效模式。

insider
edge-ai
llm-inference
model-compression
+1
·tian

混合云边 LLM 推理:端侧模型何时优于云端

生产团队正将 60–80% 的 LLM 查询路由到端侧模型——将延迟降低到 20 ms 以下,消除了数据驻留的烦恼,并大幅削减了云端推理成本。这是一份关于混合云边推理背后的路由、压缩和架构模式的实用指南。

edge-ai
llm-inference
on-device-ai
model-compression
·tian

LLM 排队论:为什么你的负载均衡器按请求思考,而你的 GPU 按 Token 思考

将利特尔法则、优先级队列和准入控制应用于基于 Token 的 LLM 推理工作负载——探讨为什么请求级负载均衡会失效,工作保留调度器如何释放额外 30-70% 的 GPU 吞吐量,以及防止生产环境意外的容量规划数学。

insider
llm-inference
queuing-theory
gpu-scheduling
+1
·tian

生产环境中的 MoE 模型:稠密模型基准测试所掩盖的服务特性

稀疏 MoE 模型所需的 GPU 显存是其激活参数量的 8.6 倍,且表现出稠密模型监控容易忽略的延迟波动,并打破了朴素的批处理假设。本文将深入分析基准测试中经常忽略的服务端细节。

insider
moe
llm-inference
gpu-serving
+1
·tian

生产环境下的自托管 LLM:没人告诉你的 GPU 显存计算公式

生产环境下的自托管 LLM GPU 显存规划几乎总是出错,因为团队往往只根据模型权重估算而忽略了 KV 缓存。本文将详细解析其中的计算逻辑、INT4/FP8/FP16 之间的量化权衡、推理框架选择,以及从云端 API 转向自托管的真实盈亏平衡计算。

insider
llm-inference
self-hosting
gpu
+2
·tian

持续批处理:LLM 服务中提升 GPU 利用率的最关键技术

深入探讨迭代级调度如何取代静态批处理,在生产环境的 LLM 服务中实现 4–8 倍的 GPU 吞吐量提升,以及在高并发场景下出现的失效模式。

insider
llm-inference
gpu
serving
+2
·tian

AI 流水线中的投机执行:通过押注未来降低延迟

大多数 LLM 流水线之所以是顺序执行纯属偶然。投机执行 —— 通过并行运行假设、预取工具调用以及同步生成候选输出 —— 可以将体感延迟降低 2–4 倍,但前提是你需要理解协调开销何时会抵消这些收益。

llm-inference
ai-agents
latency
performance
+1
显示第 13–20 篇,共 20 篇
上一页2 / 2