博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
你的智能体对话记录是可被取证的,且法务从未批准过
你的智能体会记录每一个推理步骤,因为可观测性对此有需求,且存储成本低廉。但帮助你调试的 Trace 追踪记录同样也是传票的磁铁。在数据落地前,保留行动账本,让思考过程过期,并脱敏个人隐私信息(PII)。
你的 AI 账单只是一个未标记的行项目:当 Token 拒绝被标记时的 FinOps
模型 API 按 Key 和时间计费,而不是按功能或客户计费,因此你的 AI 支出最终只是一个未标记的行项目。本文将探讨为什么 Token 成本难以像云资源那样进行标记,以及在调用时应如何进行埋点以解决这一问题。
你模型的置信度分数只是一种感觉,而非概率
LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。
你的评估测试集对现任模型存在过拟合
私有评估集往往源自单一模型的生产环境故障,因此它会偏向现任模型,并低估所有挑战者。应将回归测试与能力测试分开,并针对真实的业务流量进行测试。
智能体输出的验收抽样:制造业质量保证领先于代码审查的秘诀
智能体每周交付数百个 PR,而其中大多数完全没有经过审查。制造业在一个世纪前就通过验收抽样解决了这个问题——利用 AQL 表、批次拒收和转移规则,将对智能体的信任从“凭感觉”转变为明确且可衡量的制度。
对你的工具接收的内容保持严格:波斯塔尔法则在智能体系统中失效
宽容地处理格式错误的工具参数看似健壮,但会悄无声息地将 Schema 违规转化为评估无法发现的数据损坏。严格拒绝并提供模型可读的错误反馈,才是让智能体循环具备自纠错能力的关键。
Best-of-N 是一种架构,而不仅仅是打榜技巧
在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。
爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
舰队级 CODEOWNERS:当作者是 AI Agent 时的评审路由
基于路径的 CODEOWNERS 假设作者知道自己在谁的地盘上——而 AI Agent 并不知晓。本文探讨了为什么 Agent 的 diff 会导致评审队列僵局,以及如何通过基于担保人的路由、分目录的自主权预算以及“模式 + 抽样”的 Codemod 评审来解决这一问题。
当你最大的客户端是 Prompt 时,如何弃用 API
AI 智能体不会阅读更新日志 —— 它们对你 API 的认知被冻结在 Prompt、工具 schema 和训练数据中。本文将探讨为什么关闭 v1 版本会导致重试风暴而非迁移,以及如何通过适配器、Sunset 响应头和智能体可读的错误信息来解决这一问题。
内部试用 (Dogfooding) 你的 Agent 并不等于 QA
内部用户会默默地修正 Agent 的错误、规避其弱点,并在 Slack 中分享绕过问题的方法 —— 这使得内部试用指标在真实客户流失前看起来异常完美。你应该转而监测修复事件、编辑距离和冷启动用户群组。
Token FinOps:将 AI 支出归因到具体功能
你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。