Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策
预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。
Prompt 缓存悬崖:一次系统提示词修改如何重置你的整个集群成本
在系统提示词顶部进行的一行修改可能会瞬间导致所有缓存前缀失效,使你的缓存命中率降至零,并让推理账单在隔夜之间翻倍 —— 本文将探讨其背后的原因,以及如何构建提示词结构以防止这种情况发生。
Best-of-N 是一种架构,而不仅仅是打榜技巧
在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。
当硬件说谎时:静默数据损坏遇上随机性软件
大约每千个加速器中就有一个会静默地计算出错误答案,而 LLM 推理是第一个硬件故障与采样噪声看起来完全一致的大规模工作负载。本文将探讨位翻转如何隐藏在随机输出中,以及如何利用金丝雀通道和单机统计数据来捕捉说谎的 GPU。
思维的 p99:当模型决定你的请求耗时多久
推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。
零温度并非确定性:复现那些你无法重新运行的事故
将温度设置为零会强制执行贪婪解码,但这并不能使 LLM 推理具有可复现性。导致 Token 发生跳变的并不是采样器,而是与 Batch 相关的 GPU 数值计算 —— 本文将介绍如何为你无法重新运行的实例构建事故后分析。
你发出的流式中止信号,供应商照样收了费:账单中隐藏的 14% 差额
你的停止按钮触发了 AbortController.abort(),但供应商会持续生成直到下一个批处理边界,并对差额部分计费。这种差额是一个可衡量的工程问题,且涉及财务责任。
在解码中途缩减至零的自动伸缩器:当推理被视作无状态网络流量时
一个成本驱动的缩容策略将一个 30 分钟的长上下文作业视为无状态的 HTTP 请求。Pod 在解码中途被回收,唯一的信号是一个小时后网关日志中的 499 错误。这篇复盘报告将自动伸缩重新定义为一个工作负载形态问题。
你的评估套件设置了确定性种子,但供应商却悄悄忽略了它
你的评估流水线设置了 seed=42 并报告了可复现的数值。然而,供应商可能在网关处丢弃了它,批次大小在负载下发生了变化,或者系统指纹在一夜之间轮换了 —— 你的基准测试离得到一个完全不同的答案其实只差一个批次的距离。
确定性种子:为什么供应商将其视为“提示”而非“契约”
托管 LLM API 上的 seed 参数只是尽力而为的提示,而非契约。本文探讨了为什么字节级精确的 CI 断言会失效,以及你应该断言什么。
批处理负载挤占了你的实时路径:GPU 预留的惨痛教训
在夜间训练和晨间推理之间共享同一个 GPU 池看起来是提高了利用率,直到 p99 仪表板揭示了其负外部性的代价。为什么 GPU 分区必须是物理的,资源核算必须遵循延迟类别,以及早晨的尾部延迟问题无法通过软件层面修复。
不属于你的那次变慢:对话中途的 KV 缓存逐出
在第十二轮,你对话的首字延迟暴涨 4 倍,而追踪日志什么也解释不了。你所依赖的 KV 缓存被另一个租户的请求驱逐,而你没有任何遥测指标能点出原因。