FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单
模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。
Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策
预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。
Token FinOps:将 AI 支出归因到具体功能
你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。
批处理层级是 AI 时代的竞价实例
你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。
你的 AI 工作负载也有“夜晚”:批处理折扣是对架构的考验
每一个主要的供应商都通过批处理 API 以半价销售同样的 token,但大多数团队从未获得过这一折扣,因为他们从未对哪些推理调用确实需要即时响应进行过分类。本文介绍了一个延迟分道(latency lanes)框架、批处理所需的架构重构,以及为什么 50% 的折扣是结构性的。
Token 预算是变相的人员编制决策
关于 Prompt 消耗多少 Token 的每一个选择,本质上都是在工程师时间、支持压力和基础设施成本之间进行隐形博弈。本文提供了一个框架,旨在让这种权衡显性化,而非任其随时间累积。
租赁智能:CFO 的 LLM 支出心理模型
Token 支出表现得更像销售成本(COGS)而非研发费用(R&D)——将随用量扩大的成本当做固定成本来定价,正是让财务团队措手不及的原因。本文提供了一个预测 LLM 支出、识别利润陷阱并决定何时“租赁智能”才划算的实用模型。
你的 Agent 每一轮都在重新生成对话摘要,只因缓存键包含了一个时间戳
一行为了调试而做的代码变更,在摘要缓存键中加入了一个时间戳,导致 LLM 账单在两周内悄无声息地翻了三倍 —— 本文探讨了为什么缓存键是一项契约而非简单的工程细节,以及为什么缓存命中率必须作为核心观测指标。
供应商上调 max_tokens 默认值,导致你的尾部响应长度翻倍
一家 LLM 供应商悄悄调高了 max_tokens 的默认值,导致你的 p99 输出长度在一夜之间翻了一倍。那些你没有显式传递的参数,往往就是背后发生变化的配置 —— 本文将介绍如何停止继承那些你无法控制的默认设置。
为了节省 Token 而被你剥离的思维链,其实隐藏着一项合规证据要求
为了降低推理成本而剥离推理 Token 看起来是一项简洁的优化,直到审计员要求你提供一个你已不再生成的合规理由。推理踪迹是具有双重用途的产物 —— 它们既是工程成本项,也是受监管的证据 —— 而负责提示词的团队往往并不负责审计工作。
被你的个性化层悄悄杀掉的 Prompt 缓存
在系统 Prompt 顶部放置单用户上下文是让你的推理账单翻三倍的隐形陷阱。本文将揭示为什么这种“成本悬崖”在账单结算前难以察觉,以及如何在代码、代码评审和 CI 中守护缓存边界。
把每个工具都当作 O(1) 的规划器
为什么智能体规划器会选出正确但代价极高的工具序列,以及无需重新训练模型即可让规划具备成本感知能力的模式级改造。