·tian
量化质量悬崖:当 int4 通过中位数评估却在长尾场景失效时
int4 量化将推理成本减半,且几乎不影响中位数基准测试——却在悄无声息地破坏稀有 Token 补全、低资源语言和长文本推理能力。本文将探讨为什么这种“悬崖式”下降在通过审核的评估套件中是不可见的,以及如何在客户发现之前通过上线纪律让这种退化显现出来。
insider
quantization
llm-inference
model-evaluation
+1·tian
静默量化:为什么你今天付费的模型不再是上个季度购买的那个
随着推理经济效益的收紧,供应商在相同的模型名称下悄悄切换到了精度更低、成本更廉价的层级。本文将探讨为什么版本字符串不再是一份契约,以及用来替代它的探测集、路由层和 SLA 条款。
llm-ops
inference
evals
vendor-management
+1·tian
边缘 LLM 推理:当延迟、隐私或成本迫使你离开云端
一个在单 GPU 上微调的 7B 模型可以在特定领域以零边际 token 成本击败 GPT-4。关于硬件选型、量化格式、混合本地-云端路由以及使边缘 LLM 推理达到生产级别的部署框架的实用指南。
edge-ai
llm-inference
quantization
on-device-ai
+1·tian
多模型推理服务的 GPU 显存计算:为什么大多数团队会过度配置 3 倍资源
在并发负载下,主导 GPU 显存的是 KV 缓存而非模型权重。本文将介绍容量规划的精确公式、量化权衡(AWQ vs GPTQ vs GGUF)以及装箱策略,让你在仅够运行 1 个模型的硬件预算下提供 4 个模型的服务。
insider
gpu-inference
llm-serving
quantization
+1·tian
生产环境下的自托管 LLM:没人告诉你的 GPU 显存计算公式
生产环境下的自托管 LLM GPU 显存规划几乎总是出错,因为团队往往只根据模型权重估算而忽略了 KV 缓存。本文将详细解析其中的计算逻辑、INT4/FP8/FP16 之间的量化权衡、推理框架选择,以及从云端 API 转向自托管的真实盈亏平衡计算。
insider
llm-inference
self-hosting
gpu
+2