跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

AI 功能的闲置成本该由谁承担

无论是否有流量,预置吞吐量、预留 GPU 以及热启动的向量索引都会产生费用。闲置成本之所以不断增长,是因为它处于产品、基础设施和财务之间的组织缝隙中 —— 本文将探讨如何让这一差距变得透明并明确归属。

finops
ai-infrastructure
cost-optimization
llmops
·tian

谁该为模型的错误买单:在智能体产品中设计责任机制

智能体错误不仅仅是客服升级——它们是带有明确责任方的计费事件。本文将探讨如何在收到第一张愤怒的工单之前,设计责任模型、来源追踪、可逆性层级以及错误成本评估。

ai-agents
product-design
unit-economics
liability
+1
·tian

你无法通过邮件给模型发送变更日志:为什么当调用者是 LLM 时,API 弃用机制会失效

LLM 调用者没有收件箱,没有稳定的身份,也没有义务阅读你的迁移指南。本文将探讨为什么沿用了 15 年的 API 弃用策略在 Agent 面前会失效,以及我们应该如何改进工具 Schema、错误信息和网关。

api-design
llm-agents
deprecation
tool-calling
·tian

你的提示词专家只有 14 个月的半衰期

掌握你提示词和评估知识的工程师,其市场估值的上涨速度远快于你的薪酬体系调整速度。本文将解释为什么通用 IC 职级晋升标准无法识别他们的价值,以及在他们离开之前你应该做出哪些改变。

ai-engineering
engineering-management
retention
career-ladder
·tian

Agent 记忆是一个没有失效策略的缓存

长期记忆通常被作为一项功能发布,但它本质上是一个关于不断变化的世界的事实缓存。如果没有失效、溯源和冲突规则,它就会变成一个缓慢发生的正确性 Bug。

ai-agents
memory
caching
llm
+1
·tian

置信度分数税:为什么询问模型它有多确定比直接出错成本更高

在 LLM 输出中添加置信度字段看起来是免费的。但事实并非如此。本文将介绍它所带来的单次请求“税”、为什么该数字很少经过校准,以及在根据它进行生产流量路由之前需要衡量什么。

insider
llm
calibration
ai-engineering
+2
·tian

删除评估用例是决策,而非清理

为了提升速度或降低成本而裁剪评估套件表面上是维护,但每删除一个用例都意味着放弃了一项团队不再能直观看到的保证。借鉴 API 弃用生命周期,有计划地退役评估用例。

insider
llm-evals
regression-testing
testing
+1
·tian

PM 与评测之间的翻译鸿沟:当发布决策超越了词汇表

评测分数是 AI 质量的一种有损压缩,而负责发布的产品经理往往无法将其解压缩。本文将为你提供一座扫盲桥梁,让发布决策锚定在数据之上,而不是取决于谁的声音最大。

ai-engineering
product-management
evaluation
cross-functional
·tian

改变答案的重试:针对非确定性 LLM 调用的幂等键

重试超时的 LLM 调用并不会重新获取相同的答案 —— 而是会采样一个新的。本文将探讨为什么针对非确定性后端的超时重试会失效,以及幂等键如何让它重新变得安全。

insider
llm
reliability
idempotency
+1
·tian

先返回 200 然后失败的流式响应:中途错误如何破坏你的 SLO

流式端点在第一个 token 刷出的瞬间就会确认 200 状态,因此之后发生的每一个失败都会躲过负载均衡器、重试中间件和 SLO 仪表板。本文将介绍如何让响应体承担起 HTTP 头部已无法传达的判定结论。

streaming
observability
reliability
llm
+1
·tian

具有两种延迟的 AI 功能:你衡量的是一种,用户感知的是另一种

流式 AI 功能具有两种分化的延迟 —— 首字时间 (TTFT) 和完成时间 —— 而大多数团队只测量了用户感知最不明显的那一个。本文将介绍如何拆分指标和 SLO。

llm
latency
observability
streaming
+1
·tian

当“智能体能做 X 吗?”演变为交付承诺时

当“运行成功一次”的说法经过每日站会、路线图和销售电话后,AI 能力探针会悄然演变为路线图承诺。本文介绍了一套能力测试产物和晋级关卡,旨在防止演示原型在不成熟时就变成合同条款。

insider
ai-engineering
product-management
evaluation
+1
显示第 517–528 篇,共 2312 篇