跳转到主要内容

22 含有标签「llm-cost」

Posts tagged "llm-cost" on TianPan.co.

查看所有标签

·tian

上下文膨胀:你无法用 Grep 搜寻的 AI 内存泄漏

长期运行的智能体对话会悄无声息地泄露 Token —— 二次增长的成本和性能下降隐藏在对话历史中。本文介绍如何监控、修剪和压缩上下文。

insider
ai-agents
context-engineering
observability
+1
·tian

你的 LLM 账单只占 Agent COGS 的一半 —— 另一半是无人监控的部分

推理仅占 Agent 真实成本的 40-60%。另一半则隐藏在向量数据库、检索嵌入、遥测、重试、评估和人工审核中 —— 而这些成本往往没有明确的归口团队。

insider
ai-agents
finops
unit-economics
+2
·tian

你的 AI 定价页面是一场对 Token 经济学的杠杆押注

按席位定价的无限次 AI 套餐是对 Token 波动性的裸空。厂商调价、重度用户行为偏移以及模型配比的潜移默化,会瞬间挤压毛利——除非在页面上线前,就已内置好归因、用量限制和分层梯度。

ai-engineering
pricing
llm-cost
finops
+1
·tian

推理成本预测:财务团队想要而你写不出来的容量规划

经典的容量规划假设工作负载是可衡量的,且单位成本是稳定的。AI 工作负载打破了这两点——你交给财务部门的 SaaS 风格预测,正是他们不断要求重新调整基准的原因。本文介绍了它应该采取的四项 FinOps 准则。

finops
ai-engineering
llm-cost
capacity-planning
+1
·tian

Agent 工作流的碳计算:Token 预算现已成为 ESG 披露

Agent 工作流消耗的能量可能是单次对话补全的 50–200 倍,采购团队已经开始关注这一指标。本文是一份关于逐任务碳归因、碳预算强制要求的路由决策,以及为什么率先进行观测的团队能掌控话语权的务实指南。

insider
ai-agents
sustainability
observability
+2
·tian

小费罐问题:当 5% 的用户消耗了 80% 的推理预算时

针对以 token 计费的 AI 产品,固定费率定价会导致用量的幂律分布,极少数的“推理大户”会摧毁你的利润空间。传统的解决方法——如用量限制、降速、公平使用条款——会疏远那些如果你允许,他们本愿意支付更多费用的高参与度用户。本文将介绍真正符合 token 成本行为的分层架构、计量前期工作以及单位经济效益规范。

ai-pricing
unit-economics
llm-cost
usage-based-pricing
+1
·tian

取消税:用户点击停止后的推理账单

点击停止只是停掉了你的 UI,而不是 GPU。大多数供应商会完成生成,并为你那些用户从未读过的 Token 计费。本文将介绍如何衡量并缩小这一差距。

llm-cost
finops
streaming
observability
+1
·tian

模型账单仅占你推理成本的 30%

Token 支出仅仅是六项预算中的一项。通过对检索、可观测性、重试和人工审核的真实拆解,我们将揭示为什么通过更换模型来实现的成本节省往往并不真实。

llm-cost
finops
rag
observability
+1
·tian

规划税:为什么你的智能体把更多 Token 花在思考上而非执行上

LLM 智能体在执行第一个工具调用之前,会将 40-70% 的 token 预算消耗在规划上。本文拆解推理 token 的流向,分析为何更多思考并不总能带来更好的结果,并介绍 ReWOO、计划缓存、层次分解等可以收回预算的架构模式。

insider
ai-agents
token-optimization
llm-cost
+1
·tian

智能体循环中的推理模型溢价:何时“思考”值得,何时不值得

推理模型的单次查询成本最高可达标准模型的 86 倍 —— 并且在智能体循环中,该成本会随每次迭代而叠加。本文提供了一个实用的决策框架,帮助你判断何时应路由到推理模型,以及何时选择快速模型更为明智。

insider
reasoning-models
agent-loops
llm-cost
+1
显示第 13–22 篇,共 22 篇
上一页2 / 2