跳转到主要内容

4 含有标签「kubernetes」

Posts tagged "kubernetes" on TianPan.co.

查看所有标签

·tian

在解码中途缩减至零的自动伸缩器:当推理被视作无状态网络流量时

一个成本驱动的缩容策略将一个 30 分钟的长上下文作业视为无状态的 HTTP 请求。Pod 在解码中途被回收,唯一的信号是一个小时后网关日志中的 499 错误。这篇复盘报告将自动伸缩重新定义为一个工作负载形态问题。

insider
inference
autoscaling
kubernetes
+2
·tian

批处理负载挤占了你的实时路径:GPU 预留的惨痛教训

在夜间训练和晨间推理之间共享同一个 GPU 池看起来是提高了利用率,直到 p99 仪表板揭示了其负外部性的代价。为什么 GPU 分区必须是物理的,资源核算必须遵循延迟类别,以及早晨的尾部延迟问题无法通过软件层面修复。

gpu
scheduling
infrastructure
inference
+1
·tian

为什么 AI 生成的 Terraform 和 Kubernetes 配置在潜移默化中出错

LLM 生成的 Terraform、Kubernetes 配置清单和 CDK 虽然能通过语法检查,但往往带有幻觉依赖、过时的 Provider 模式以及只有在生产环境中才会显现的安全漏洞。本文将分析这些失效模式的分类,并探讨哪些工具能真正捕捉到这些问题。

infrastructure-as-code
terraform
kubernetes
security
+1
·tian

混合 LLM 工作负载的 GPU 调度:那个没人解决好的装箱问题

在共享 GPU 集群上服务多个 LLM 模型会浪费 30–50% 的可用算力。本文解析 Kubernetes GPU 调度为何不适用于 LLM 推理,以及真正有效的解决方案。

insider
llm
infrastructure
gpu
+2