跳转到主要内容

9 含有标签「gpu」

Posts tagged "gpu" on TianPan.co.

查看所有标签

·tian

当硬件说谎时:静默数据损坏遇上随机性软件

大约每千个加速器中就有一个会静默地计算出错误答案,而 LLM 推理是第一个硬件故障与采样噪声看起来完全一致的大规模工作负载。本文将探讨位翻转如何隐藏在随机输出中,以及如何利用金丝雀通道和单机统计数据来捕捉说谎的 GPU。

insider
ai-engineering
reliability
gpu
+2
·tian

GPU 调度是一个排队问题,而不是资源配置问题

LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。

insider
llm-inference
gpu
scheduling
+2
·tian

在解码中途缩减至零的自动伸缩器:当推理被视作无状态网络流量时

一个成本驱动的缩容策略将一个 30 分钟的长上下文作业视为无状态的 HTTP 请求。Pod 在解码中途被回收,唯一的信号是一个小时后网关日志中的 499 错误。这篇复盘报告将自动伸缩重新定义为一个工作负载形态问题。

insider
inference
autoscaling
kubernetes
+2
·tian

批处理负载挤占了你的实时路径:GPU 预留的惨痛教训

在夜间训练和晨间推理之间共享同一个 GPU 池看起来是提高了利用率,直到 p99 仪表板揭示了其负外部性的代价。为什么 GPU 分区必须是物理的,资源核算必须遵循延迟类别,以及早晨的尾部延迟问题无法通过软件层面修复。

gpu
scheduling
infrastructure
inference
+1
·tian

GPU 算力是产品路线图的约束:决定第三季度的 18 个月合同

多年期 GPU 承诺悄然将产品路线图与那些从未见过功能列表的人所做的容量决策绑定在一起。这里是弥合这一差距的规划准则。

ai-engineering
finops
capacity-planning
gpu
+1
·tian

GPU 饥饿:某个租户的推理提示词如何导致你的共享推理端点停滞

一个推理提示词就能拖慢共享推理端点上所有其他请求的 p99 延迟。本文将探讨为什么连续批处理和 KV 缓存钉选会导致队头阻塞,分析鲜有人关注的诊断信号,并介绍四种缓解方案 —— 分块预填充、优先级调度、每租户 Token 上限以及请求类别隔离 —— 按其侵入性由低到高排序。

insider
llm-inference
gpu
multi-tenant
+2
·tian

混合 LLM 工作负载的 GPU 调度:那个没人解决好的装箱问题

在共享 GPU 集群上服务多个 LLM 模型会浪费 30–50% 的可用算力。本文解析 Kubernetes GPU 调度为何不适用于 LLM 推理,以及真正有效的解决方案。

insider
llm
infrastructure
gpu
+2
·tian

生产环境下的自托管 LLM:没人告诉你的 GPU 显存计算公式

生产环境下的自托管 LLM GPU 显存规划几乎总是出错,因为团队往往只根据模型权重估算而忽略了 KV 缓存。本文将详细解析其中的计算逻辑、INT4/FP8/FP16 之间的量化权衡、推理框架选择,以及从云端 API 转向自托管的真实盈亏平衡计算。

insider
llm-inference
self-hosting
gpu
+2
·tian

持续批处理:LLM 服务中提升 GPU 利用率的最关键技术

深入探讨迭代级调度如何取代静态批处理,在生产环境的 LLM 服务中实现 4–8 倍的 GPU 吞吐量提升,以及在高并发场景下出现的失效模式。

insider
llm-inference
gpu
serving
+2