长出胳膊和腿的缓存提示词前缀
六个月前你的提示词前缀是 4k tokens,几乎可以摊销到免费。今天它是 11k tokens,你的缓存命中率是 31%,没有人能指出是哪个 PR 干的。
你的模型路由是一个看不见负载的负载均衡器
模型路由在模型执行任何操作之前就决定了由哪个模型处理查询 —— 但它所需的难度信号仅存在于答案中。本文将探讨为什么分类器准确率会带有误导性,为什么错误路由看起来像是平庸的质量而非明显的错误,以及如何监测真正随路由质量波动的下游信号。
填充式工具调用:当智能体在表演勤奋而不是真正干活
生产环境中的智能体不断发出对答案毫无影响的工具调用——烧掉 token、拖慢延迟、损害准确率。本文讲清楚填充式调用是如何从训练中长出来的、它真正的成本是多少,以及如何用反事实测量和调用预算把它从工作流里剔除出去。
对话的平方成本:为什么 AI 聊天支出呈超线性增长
一次 10 轮的对话成本大约是单轮对话的 55 倍,而非 10 倍,因为每一轮都会对整个历史记录重新计费。本文将分析 N 平方背后的数学原理、为什么缓存无法彻底解决问题以及如何对其进行限制。
当廉价模型变得更昂贵时
将流量路由到较小的模型虽然降低了每 token 的成本,但可能会增加每个完成任务的成本。本文将分析节省的成本是如何流失的 —— 以及你如何在发布前进行衡量。
AI 功能的闲置成本该由谁承担
无论是否有流量,预置吞吐量、预留 GPU 以及热启动的向量索引都会产生费用。闲置成本之所以不断增长,是因为它处于产品、基础设施和财务之间的组织缝隙中 —— 本文将探讨如何让这一差距变得透明并明确归属。
自我批判税:让模型检查自己的工作如何导致成本翻倍却收益甚微
Self-Refine、验证链(Chain-of-Verification)和反思提示词在基准测试中承诺了巨大的质量提升 —— 但在生产环境中,它们会使成本增加三倍,导致延迟激增,而实际收益却远低于宣传水平。本文将教你如何在上线前评估这项 “自我批判税”。
小模型,大账单:为什么单 Token 成本更低反而更贵
为了降低单 Token 成本而切换到更小的模型,可能会在不知不觉中增加你的 LLM 账单。正确的衡量单位是“每次成功任务的成本”,而大多数仪表板从未测量过这一指标。
Token 感知型日志:当你的追踪成本超过其观测的推理成本时
AI Agent 的遥测流水线现在的预算开销已经超过了它们所观测的 LLM 调用。本文介绍了一个逐字段的成本模型——包括 Prompt 指纹识别、基于结果的采样、分级存储——旨在将观测成本控制在合理的服务成本 (COGS) 范围内。
AI 功能回报期:让财务团队不再质疑的 ROI 模型
传统 ROI 电子表格无法适用于 AI 功能。本文提供一套工程和财务团队都能接受的成本拆解与回报模型。
AI产品的暗能量:没人预算过的后台计算
每个拥有持久化状态的AI产品都在运行不可见的推理,这些推理永远不会出现在你的延迟仪表盘或成本模型中。本文告诉你如何找到它、度量它,并决定是否关掉它。
AI 流水线中的惰性评估:不到万不得已,不要调用 LLM
在典型的 AI 流水线中,实际上只有 4.9% 的 Token 需要大模型处理。通过语义缓存、复杂度路由、早期退出和延迟生成等分层惰性评估策略,可以在不牺牲质量的情况下将 LLM 成本降低 30–70%。