那个没人同意却成了规范的评估套件
大多数 Agent 团队没有需求文档 —— 评估套件默认成为了规范。为什么全绿的评估运行结果只证明了一个工程师的假设,以及如何以 API Schema 的评审严谨度来对待评估集。
PM 与评测之间的翻译鸿沟:当发布决策超越了词汇表
评测分数是 AI 质量的一种有损压缩,而负责发布的产品经理往往无法将其解压缩。本文将为你提供一座扫盲桥梁,让发布决策锚定在数据之上,而不是取决于谁的声音最大。
当“智能体能做 X 吗?”演变为交付承诺时
当“运行成功一次”的说法经过每日站会、路线图和销售电话后,AI 能力探针会悄然演变为路线图承诺。本文介绍了一套能力测试产物和晋级关卡,旨在防止演示原型在不成熟时就变成合同条款。
Prompt 即文档:当系统 Prompt 成为唯一可信的交付物时
当 PM、支持团队和销售开始通过阅读系统 Prompt 来了解产品功能时,这既是一种褒奖,也是一种结构性失效。本文将介绍如何保留有效的部分并修复其余问题。
你的 PRD 只是一个未经测试的 Prompt —— 直到你对其进行评测
AI 功能的 PRD 本质上是一个未经编译的系统提示词。在验收前进行评测,能让定义不明确的问题在上线前就暴露出来。
Agent 烙印:当市场部负责命名,而工程部支付运维账单时
市场部将工作流称为 Agent,而工程部则继承了无人规划的可观测性、工具预算和升级处理工作——这是一个包装成命名选择的领导层决策。
你的评估套件就是你拒绝编写的产品需求文档
PRD 中模糊的形容词(如 “有帮助” 和 “简洁”)在模型面前很难生存 —— 评估套件才是这些决策真正落地的场所。请将评估视为产品规格,而非仅仅是测量工具。
为什么回滚 AI 功能比回滚代码更难
技术层面的代码回滚可以修复系统,但无法修复用户。本文将探讨为什么 AI 行为的改变具有代码变更所不具备的“粘性”,以及如何在不破坏信任的前提下,让你重新获取设计空间的模式。
AI 功能的 PRD:为什么你的旧模板会让你在悬崖边失足
确定性的 PRD 缺乏对模型错误、发布评估门槛或系统提示词所有权的定义。这四个章节将为你解决这些问题。
为什么你的 AI 路线图不应该有 12 个月的计划
前沿模型的能力每 90 天就会发生更替。一份为期 12 个月的功能路线图会让你陷入过时的博弈中。请将其替换为具有明确终止标准的能力组合。
停用 AI 功能是一次信任事件,而非简单的功能弃用
停用 AI 助手带来的破坏与弃用 API 不同 —— 你的执行手册需要包含分群分析、维护成本台账,以及针对“人际关系”而非“合同条款”进行校准的沟通方式。
AI 功能与 OKR 的错位:为什么季度节奏会破坏 AI 路线图
季度 OKR 是为确定性软件校准的。AI 功能具有发布曲线和持续曲线,而将它们视为交付物的模板所产生的 Demo,在规划周期之间会逐渐退化。