·tian
GPU 调度是一个排队问题,而不是资源配置问题
LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。
insider
llm-inference
gpu
scheduling
+2·tian
批处理负载挤占了你的实时路径:GPU 预留的惨痛教训
在夜间训练和晨间推理之间共享同一个 GPU 池看起来是提高了利用率,直到 p99 仪表板揭示了其负外部性的代价。为什么 GPU 分区必须是物理的,资源核算必须遵循延迟类别,以及早晨的尾部延迟问题无法通过软件层面修复。
gpu
scheduling
infrastructure
inference
+1·tian
你的定时 Agent 有四个时钟,而你信任的是错误的那一个
通过 cron 触发的 AI Agent 继承了四个时钟 —— 调度器、工作节点、模型和工具 —— 而大多数生产系统都在默默地信任错误的那一个。本文将带你了解这些失败模式以及防止这些问题的‘时间交接合约’。
insider
ai-agents
scheduling
reliability
+2·tian
智能体集群并发:在没有死锁或惊群效应的情况下协调数十个智能体
LLM 智能体集群是一个小型分布式系统,而不是单个智能体的三十个副本。准入控制、AIMD 背压、熔断器和外部状态协调是防止并发集群自我崩溃的关键。
insider
ai-agents
distributed-systems
reliability
+2