长出胳膊和腿的缓存提示词前缀
六个月前你的提示词前缀是 4k tokens,几乎可以摊销到免费。今天它是 11k tokens,你的缓存命中率是 31%,没有人能指出是哪个 PR 干的。
AI 功能规格说明书中无人提及的碳排放项
每一场 AI 功能评审都在争论延迟、Token 成本和准确率——却唯独没人讨论能耗。本文将介绍如何衡量单次请求的碳排放,并将其转化为团队需要负责的关键指标。
温池与冷真相:Serverless LLM 推理中隐藏的延迟底线
将 GPU 推理缩容至零会将稳定的资金成本转化为隐藏在 p99 尾部延迟中的尖峰延迟成本。本文将为你介绍盈亏平衡计算方法和缓解工具集。
智能体临时目录:无人盘点的无主文件系统 PII 暴露面
智能体工作线程在无人分类的磁盘上累积了临时文件系统状态——提取的 PDF、转录的音频、缓存的附件。解决方案在于为这一层级命名,而非追求架构上的复杂性。
区域模型发布的“彩票”效应:当你的产品在不同大洲表现各异时
云服务商的模型发布在各区域间并不同步。你的单模型抽象层在不同大洲之间悄然分化,而评估测试集往往是最后才发现这种差异的地方。
昼夜延迟:为什么你的 AI 功能在东部时间上午 9 点最慢
前沿模型的延迟遵循由他人流量决定的每日曲线。通过分时段队列、批量路由和负载感知故障转移,可以将这种“幽灵般的”性能退化转变为一个调度问题。
AI 功能依赖图:当多个服务共用同一个模型时的韧性工程
当 15 个产品功能共享同一个嵌入模型和 LLM 端点时,一旦供应商发生故障,就会演变成一场没有堆栈跟踪的分布式系统崩溃。本文将探讨如何映射 AI 功能依赖关系、在每一层应用熔断器,并设计降级链,使功能在故障时能够干净地退出,而不是导致输出错误。
你的负载测试在撒谎:生产环境中的 LLM 供应商容量争用
LLM API 是多租户共享基础设施 —— 你的负载测试在凌晨 2 点通过,但生产环境的延迟在周二上午 9 点却出现飙升。了解共享峰值需求的机制以及保护你 SLO 的架构模式(多供应商对冲、熔断器、预留容量)。
配额饥饿:当你的 AI 功能相互消耗速率限制时
当多个 AI 功能共享同一个 API 密钥时,优先级由谁先发出请求隐式决定。以下是如何在批处理任务饿死面向用户的功能之前,让配额分配变得明确。
多租户 LLM 推理中的调度公平性:为什么 FIFO 是错误的默认选择
当多个团队共享 LLM 推理基础设施时,朴素的 FIFO 调度会导致优先级反转和 SLO 违规。以下是生产环境中公平调度的真实面貌。
向量维度税:嵌入维度如何悄然侵蚀你的预算
大多数团队从模型默认值中选取嵌入维度,而不衡量其成本。本文介绍维度如何影响存储、延迟和质量,以及如何有意识地进行权衡。
AI产品的暗能量:没人预算过的后台计算
每个拥有持久化状态的AI产品都在运行不可见的推理,这些推理永远不会出现在你的延迟仪表盘或成本模型中。本文告诉你如何找到它、度量它,并决定是否关掉它。