
Tian Pan
Software Engineer
没人阅读的审批提示
千篇一律的确认弹窗会训练用户不加阅读就点击『批准』——这与摧毁浏览器警告、医院警报和 SOC 告警的习惯化机制如出一辙。本文讲解如何对智能体操作做风险分级,并设计出人类真正会停下来看的中断提示。
一次回填,让你的整个 AI 账单重新运行
一次重新索引、重放或迁移操作,可能会悄无声息地以全价 token 重新处理你的整个语料库——几天后账单便会送达。本文将介绍如何在大型 AI 重新处理任务让你措手不及之前,对其进行估算、设置上限和分阶段执行。
评估了错误的 RAG 管道环节
一个 RAG 系统本质上是由两台机器组成的,但大多数评估框架只给生成器评分。本文将解释为什么检索环节需要独立的评分体系,以及如何构建它。
在 18 个月后复现 AI 决策
一旦模型、提示词和检索索引都发生了轮换,复现你在 18 个月前做出的 AI 决策几乎是不可能的。本文将介绍如何在推理时捕捉具有说服力的决策记录。
淘汰嵌入模型:在不中断搜索的情况下重新索引数百万个向量
更换嵌入模型表面上看起来只是配置更改,但实际上是一次完整的数据迁移。本文将介绍如何重新嵌入语料库、执行双索引切换、预估成本和时间,并在你的用户发现问题之前证明新索引的效果更佳。
那个因等待另一个 Agent 而死锁的 Agent
两个能力出色的 Agent 可能会在你的账单飞涨时永远互相等待。为什么是协作——而非模型能力——导致了 Agent 群体的崩溃,以及分布式系统准则如何修复这一问题。
你的智能体从未执行过的补偿事务
AI 智能体在现实世界中执行不可逆的操作,往往无法撤销。借用 Saga 模式:为每个工具配对一个补偿事务,对不可逆行为设置门控,并在执行前记录日志。
你的智能体读不懂的弃用通知
智能体不会阅读更新日志或 Sunset 响应头。本文将探讨为什么工具弃用对大语言模型智能体来说会静默失败,以及如何对工具契约进行版本化,从而让模型能够真正接收到通知。
无人值守的人工升级路径
每个智能体流程图中的“转人工”方框,通常指向一个没有负责人、没有 SLA、也没有人值班的队列。应将升级视为一个需要专人负责的产品界面,而不仅仅是一段代码路径。
无法回滚的功能开关:提示词
提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。
FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单
模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。
腐烂的黄金数据集:为什么你的评估集会与产品脱节
一个持续通过的黄金评估集可能在对你撒谎。本文探讨评估数据集如何因覆盖范围缺失、标签陈旧和分布偏斜而腐烂,以及如何通过数据卫生保持评分的真实性。