AI 功能与 OKR 的错位:为什么季度节奏会破坏 AI 路线图
季度 OKR 是为确定性软件校准的。AI 功能具有发布曲线和持续曲线,而将它们视为交付物的模板所产生的 Demo,在规划周期之间会逐渐退化。
AI 功能的 RACI 模型:为什么四个绿色仪表盘组合在一起却是一个破碎的产品
每个生产环境中的 AI 功能都有四个交付物负责人,却没有人为集成的用户体验负责。这种差距正是接缝漏洞产生的原因——以及填补这一空白的组织设计修复方案。
AI 面试毫无区分度:为什么你的流程无法识别能交付 LLM 产品的人才
标准的工程面试流程往往只筛选确定性系统的技能,却忽略了预测谁能交付 LLM 产品的核心能力——包括评测设计、成本直觉、提示词调试和容错思维。解决方案是重构面试流程,而不是生硬地增加一个 AI 面试环节。
聊天历史是数据库。别再把它当成滚动回溯了。
将对话历史视为滚动回溯(Scrollback),是智能体在第 8 轮对话后就开始跑题,以及上下文费用呈超线性增长的原因。解决办法是回归其本质——一个读密集型数据库——并据此进行设计。
反事实日志:通过今天的充足记录,在明年的模型上重放昨天的流量
生产环境中的 LLM 日志能很好地回答“模型说了什么”,却难以回答“模型看到了什么” —— 正是这种差距导致了数月后的模型迁移评估宣告失败。本文介绍了一种用于可重放追踪的实用模式。
Wiki 迎来了第二位租客:为什么面向 AI Agent 的文档与面向人类的文档截然不同
工程团队正悄悄地为其内部文档积累第二批受众——即每位开发者的 AI 助手。如果团队只为其中一类读者编写文档,那么提供给另一类读者的内容注定是残缺的。
评估作者的单一文化:为什么你的基准测试会变成一张自画像
评估套件并不是对你模型的测量——它是编写者的一张静态画像。在绿色的 CI 变成一个自我陶醉的谎言之前,请审计、轮换并消除基准测试中的单一文化。
评估框架(Eval Harness)而非提示词,才是你真正的供应商锁定
重写提示词是切换 LLM 供应商时最简单的部分。评估框架才是真正的供应商锁定所在 —— 当你尝试重新协商时,真正的账单就会随之而来。
你的评估准则是真正的产品规格书 —— 且没有产品经理签过字
你的工程师为了让 LLM-as-judge 跑通而编写的包含 47 条标准的评估准则,已经悄然成为了你的产品规格书。每一个权重、每一个评分边界、每一个缺失的标准,都是产品经理从未正式做出的产品决策。
评估集作为模拟器的偏移:当离线指标提升而生产表现恶化时
一个 LLM 评估套件就是一个模拟器。如果跳过重新校准周期,你可能会针对一个在第三个月就不再像生产环境的数据集发布六个“全绿”版本。
少样本腐化:为什么昨天的示例会拖累今天的模型
少样本示例是针对特定模型进行优化的。在模型升级后,那些曾经提升准确率的演示示例可能会悄无声息地开始产生负面影响 —— 本文介绍了防止腐化的审计和溯源规范。
生成式 UI 作为一种生产规程:当模型渲染屏幕时
当模型输出的是组件树而非文本时,设计评审、无障碍审计以及提示词注入威胁模型都必须从头开始重构。