Prompt 作者身份问题:三个角色同时编辑同一个文件
每个生产环境的系统 prompt 都有三个作者 —— 工程、产品和 ML —— 而且他们对什么是“变更”各执一词。这里有一套结构化的解决方案。
季度模型迁移:将其变成日程安排,而非消防演习
基础模型提供商退役模型的节奏往往不在你团队的计划之内。将每次迁移视为一次性项目,意味着每年要支付三到四次相同的设置成本。相反,应该进行季度演练——指定负责人 (DRI)、候选模型、回归测试重跑、运行手册更新——这样当下一次弃用邮件寄达时,它只是团队既定节奏中的一部分。
针对幻影库存的 RAG:当你的语料库描述产品已删除的功能时
一个 RAG 系统检索到了关于你四个月前已删除功能的文档,并自信地引导客户点击一个根本不存在的按钮。评估指标依然显示绿色。本文将探讨为什么检索和归因指标会错过这类失败,以及为了解决这个问题,组织层面需要做出哪些改变。
评估员吞吐量是评估流水线中隐藏的瓶颈
在任何重视人工评分的 AI 系统中,评估员的吞吐量都限制了评估速度。本文介绍了一套运营规范——包括校准周期、感知队列的优先级排序以及评分标准反馈循环——旨在将标注产能视为一个 SRE 问题,而非招聘问题。
重复问题检测:你的单轮评估无法察觉的会话级盲点
单轮评估分数可以保持在绿色状态,但用户可能在三次重新表述同一个问题后流失。这种失败发生在会话层面——这里告诉你如何检测和评分。
检索引用税:为什么合规性会增加 30% 的 RAG Token 账单
在 RAG 系统中添加引用看起来只是改一行系统提示词。但在受监管的租户中,它会悄无声息地让推理成本增加 25%–40%。本文将探讨为什么这种“税收”是结构性的,以及哪些架构层面的调整可以帮你挽回大部分成本。
影子评估:当私有切片取代了你的评估汇总
私有的评估 Notebook 看起来效率很高,但会让组织缺乏统一的评估汇总。解决方案是建立合并门控契约:共享框架、验证过的切片、明确的负责人,以及任何人都能重新运行的排行榜。
过时的 Few-Shot 示例以及你的提示词仓库所忽略的半衰期
你系统提示词中的经典示例正在悄悄地教导模型一个已不存在的产品。评估分数之所以保持绿色,是因为评估集也随之腐化了。
没人构建的“从支持工单到评估案例”流水线
支持工单是大多数 AI 团队拥有的信号最强的评估数据集,但在评估套件在 Git 中逐渐失效时,它们却在 Zendesk 中腐烂。这里有一个能够闭环的四阶段流水线。
随时间波动的质量偏移:为什么你的 AI 功能在东部时间上午 10 点表现不同
供应商负载不仅仅是一个带有质量副作用的延迟问题 —— 它是一种你的评估套件从未察觉的分布偏移,而你交付的功能其质量下限从未被团队真正衡量。
工具 Schema 演进陷阱:当一个可选参数改变了你 Planner 的先验分布
在现有工具描述中新增一个可选参数,发布过程顺利,没有破坏任何调用者,也没有导致评估失败 —— 但由于 Planner 的先验分布发生了偏移,它悄无声息地让工具调用频率增加了两位数。为什么工具 Schema 需要语义化版本(SemVer)、频率基准,以及与系统提示词(System Prompt)同样严格的评估规范。
你的 PRD 只是一个未经测试的 Prompt —— 直到你对其进行评测
AI 功能的 PRD 本质上是一个未经编译的系统提示词。在验收前进行评测,能让定义不明确的问题在上线前就暴露出来。