在 18 个月后复现 AI 决策
一旦模型、提示词和检索索引都发生了轮换,复现你在 18 个月前做出的 AI 决策几乎是不可能的。本文将介绍如何在推理时捕捉具有说服力的决策记录。
那个因等待另一个 Agent 而死锁的 Agent
两个能力出色的 Agent 可能会在你的账单飞涨时永远互相等待。为什么是协作——而非模型能力——导致了 Agent 群体的崩溃,以及分布式系统准则如何修复这一问题。
无法回滚的功能开关:提示词
提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。
FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单
模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。
你的 Agent 链路中无人分配的延迟预算
Agent 的 SLO 通常设置在边界处,而内部却缺乏预算分配,导致没人能归因是哪一跳搞砸了 P99。你需要分配逐跳预算,在 Span 级别进行追踪,并约束那个呈乘性而非加性增长的尾部延迟。
无人负责的对话:问责制如何在智能体移交链中消散
在多智能体系统中,每个智能体都可以通过各自的测试,但整个对话却可能失败。本文探讨了为什么移交流程会分散所有权,以及重新建立问责制的原始原语。
评分了每一轮对话却错过了整个交流:聊聊多轮评估的陷阱
95% 的单轮准确率并不意味着 95% 的会话都能成功。本文将探讨为什么平均单轮得分会掩盖复合失败,以及如何转而对整个对话进行评估。
没有根本原因的事后分析
“五个为什么”事件回顾假设存在一个模型并不具备的确定性原因。本文将介绍如何编写一份真实的 LLM 事后分析报告,它建立在故障率增量和促成因素堆栈之上,而非寻找单一的根本原因。
你的智能体对话记录是可被取证的,且法务从未批准过
你的智能体会记录每一个推理步骤,因为可观测性对此有需求,且存储成本低廉。但帮助你调试的 Trace 追踪记录同样也是传票的磁铁。在数据落地前,保留行动账本,让思考过程过期,并脱敏个人隐私信息(PII)。
你的 AI 账单只是一个未标记的行项目:当 Token 拒绝被标记时的 FinOps
模型 API 按 Key 和时间计费,而不是按功能或客户计费,因此你的 AI 支出最终只是一个未标记的行项目。本文将探讨为什么 Token 成本难以像云资源那样进行标记,以及在调用时应如何进行埋点以解决这一问题。
内部试用 (Dogfooding) 你的 Agent 并不等于 QA
内部用户会默默地修正 Agent 的错误、规避其弱点,并在 Slack 中分享绕过问题的方法 —— 这使得内部试用指标在真实客户流失前看起来异常完美。你应该转而监测修复事件、编辑距离和冷启动用户群组。
Token FinOps:将 AI 支出归因到具体功能
你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。