撤回的代价:为什么撤回一项 AI 功能比上线它更难
一旦用户围绕某项 AI 功能构建了工作流,移除它的成本将超过上线它的成本。本文探讨了为什么紧急开关往往被闲置,以及如何在上线之初就设计可逆性。
以单次对话成本为产品契约:当定价驱动架构设计时
AI 功能的定价是架构设计的输入,而非财务后的补救。为了不让工程师在午夜修补单位经济效益的漏洞,PRD 中应该包含哪些内容。
你的评估套件就是你拒绝编写的产品需求文档
PRD 中模糊的形容词(如 “有帮助” 和 “简洁”)在模型面前很难生存 —— 评估套件才是这些决策真正落地的场所。请将评估视为产品规格,而非仅仅是测量工具。
强制一致性偏见:当模型将你的意图向分布众数取整时
经过对齐的大模型会悄悄地将不寻常的请求向训练分布的众数取整。本文将探讨为什么标准评估会忽略这一点,以及捕捉这一现象的离模态约束方法。
冰封提示词:当你的团队不敢修改一个仍然奏效的系统提示词时
一个没人敢动的 4,000 token 系统提示词并非稳定,而是债务。本文探讨提示词如何演变为“冰封”状态、为何迭代会因此陷入僵局,以及如何通过考古与评估规范来解冻它们。
内部工具代理:当你杠杆率最高的 AI 功能却零客户时
面向客户的 AI 功能占据了大部分预算,但你公司中杠杆率最高的 AI 投资却是那个无人运维的内部 Slack 机器人。这里有背后的数学逻辑、失败模式以及捕捉这些价值所需的纪律性。
负面提示词是代码异味:为什么系统提示词中的每个 “不要” 都是技术债
生产环境系统提示词中的每一个 “不要” 子句,都是对行为不匹配的补丁。跟踪负面提示词的密度,将每个否定项重构为正面规范,并将残留的否定项作为一种信号,表明提示工程可能并不是解决该问题的正确工具。
幻影技能:当你的智能体展示出你从未测试过的能力
当用户基于未经测试验证的 AI 智能体行为构建工作流时,你发布的正是你无法维护的能力。在下一次模型升级悄然移除这些“幻影技能”之前,你需要一套发现它们的学科方法。
策略文件:为什么你不应该把拒绝规则写在系统提示词里
生产环境的系统提示词就像是披着一件风衣的三个配置文件——对话语气、输出格式和拒绝策略被塞进同一个工件中,共用同一个评审人和发布节奏。每一次策略修改都会导致无关任务的行为回归。这里有一种能显著获益的解耦方案。
RAG 中的新鲜度与相关度权衡:为什么你无法在查询时同时优化两者
纯语义检索会忽略时间,而基于新鲜度权重的检索则更看重活跃度而非正确性。本文将深入探讨针对每个查询的时间敏感度分类器、针对每个文档的波动性评分,以及如何通过双轴评分让 RAG 在处理稳定型和时变型问题时都能保持正确。
拒绝审计:为什么单一拒绝率掩盖了一半的失败分布
拒绝率是一个双边分布,但大多数安全仪表盘只绘制了其中一侧。本文介绍了应如何部署监控、如何采样,以及谁应该负责校准。
检索级联失效:文档删除如何毒害你的 RAG 流水线
当源文档消失时,它们的嵌入仍滞留在向量索引中,并持续返回貌似正确的错误答案。这是一份关于墓碑机制、级联失效以及检索时新鲜度检查的实战指南。