跳转到主要内容

76 含有标签「cost-optimization」

Posts tagged "cost-optimization" on TianPan.co.

查看所有标签

·tian

FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单

模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。

insider
finops
llm
cost-optimization
+2
·tian

Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策

预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。

insider
finops
llm
inference
+2
·tian

Token FinOps:将 AI 支出归因到具体功能

你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。

finops
llm
cost-optimization
ai-engineering
+1
·tian

批处理层级是 AI 时代的竞价实例

你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。

ai-engineering
llm
cost-optimization
agents
+1
·tian

你的 AI 工作负载也有“夜晚”:批处理折扣是对架构的考验

每一个主要的供应商都通过批处理 API 以半价销售同样的 token,但大多数团队从未获得过这一折扣,因为他们从未对哪些推理调用确实需要即时响应进行过分类。本文介绍了一个延迟分道(latency lanes)框架、批处理所需的架构重构,以及为什么 50% 的折扣是结构性的。

ai-engineering
llm
cost-optimization
infrastructure
·tian

Token 预算是变相的人员编制决策

关于 Prompt 消耗多少 Token 的每一个选择,本质上都是在工程师时间、支持压力和基础设施成本之间进行隐形博弈。本文提供了一个框架,旨在让这种权衡显性化,而非任其随时间累积。

llm
cost-optimization
engineering-management
ai-engineering
+1
·tian

租赁智能:CFO 的 LLM 支出心理模型

Token 支出表现得更像销售成本(COGS)而非研发费用(R&D)——将随用量扩大的成本当做固定成本来定价,正是让财务团队措手不及的原因。本文提供了一个预测 LLM 支出、识别利润陷阱并决定何时“租赁智能”才划算的实用模型。

insider
llm
finance
unit-economics
+2
·tian

你的 Agent 每一轮都在重新生成对话摘要,只因缓存键包含了一个时间戳

一行为了调试而做的代码变更,在摘要缓存键中加入了一个时间戳,导致 LLM 账单在两周内悄无声息地翻了三倍 —— 本文探讨了为什么缓存键是一项契约而非简单的工程细节,以及为什么缓存命中率必须作为核心观测指标。

insider
llm-infrastructure
caching
observability
+2
·tian

供应商上调 max_tokens 默认值,导致你的尾部响应长度翻倍

一家 LLM 供应商悄悄调高了 max_tokens 的默认值,导致你的 p99 输出长度在一夜之间翻了一倍。那些你没有显式传递的参数,往往就是背后发生变化的配置 —— 本文将介绍如何停止继承那些你无法控制的默认设置。

insider
llm
api-design
production
+2
·tian

为了节省 Token 而被你剥离的思维链,其实隐藏着一项合规证据要求

为了降低推理成本而剥离推理 Token 看起来是一项简洁的优化,直到审计员要求你提供一个你已不再生成的合规理由。推理踪迹是具有双重用途的产物 —— 它们既是工程成本项,也是受监管的证据 —— 而负责提示词的团队往往并不负责审计工作。

llm-ops
compliance
observability
ai-governance
+1
·tian

被你的个性化层悄悄杀掉的 Prompt 缓存

在系统 Prompt 顶部放置单用户上下文是让你的推理账单翻三倍的隐形陷阱。本文将揭示为什么这种“成本悬崖”在账单结算前难以察觉,以及如何在代码、代码评审和 CI 中守护缓存边界。

llm
prompt-caching
cost-optimization
personalization
+1
·tian

把每个工具都当作 O(1) 的规划器

为什么智能体规划器会选出正确但代价极高的工具序列,以及无需重新训练模型即可让规划具备成本感知能力的模式级改造。

insider
ai-agents
llm
planning
+2
显示第 1–12 篇,共 76 篇
1 / 7下一页