跳转到主要内容

4 含有标签「kv-cache」

Posts tagged "kv-cache" on TianPan.co.

查看所有标签

·tian

KV Cache 驱逐:供应商称其为“缓存压力”,而你的账单则称其为“双倍前缀费用”

Prompt 缓存看起来像是一种配置好的折扣,但在共享 LLM 基础设施上的 KV Cache 驱逐使其变成了一种概率性的折扣 —— 在不更改任何代码的情况下,同一个对话在繁忙时段的成本可能会高出数倍。

insider
prompt-caching
kv-cache
llm-cost
+2
·tian

不属于你的那次变慢:对话中途的 KV 缓存逐出

在第十二轮,你对话的首字延迟暴涨 4 倍,而追踪日志什么也解释不了。你所依赖的 KV 缓存被另一个租户的请求驱逐,而你没有任何遥测指标能点出原因。

llm
inference
kv-cache
multi-tenancy
+1
·tian

推理服务商向你隐瞒了什么:KV 缓存、批处理与延迟底线

LLM 推理基础设施内部的决策——KV 缓存逐出、连续批处理、分块预填充——在你写下第一行代码之前就决定了应用的性能边界。本文将揭示底层发生的真实情况,以及你所能控制的为数不多的参数。

llm
inference
performance
production-ai
+1
·tian

多模型推理服务的 GPU 显存计算:为什么大多数团队会过度配置 3 倍资源

在并发负载下,主导 GPU 显存的是 KV 缓存而非模型权重。本文将介绍容量规划的精确公式、量化权衡(AWQ vs GPTQ vs GGUF)以及装箱策略,让你在仅够运行 1 个模型的硬件预算下提供 4 个模型的服务。

insider
gpu-inference
llm-serving
quantization
+1