那些悄然成为你唯一评测集阅读者的提示工程师
你的评测集只是一个文件,而使其具备可读性的判断力却存在于某个工程师的脑海中 —— 本文将探讨这种巴士系数如何在他们离职后才显现出来。
被你的团队视为独立于模型版本的提示词版本
Prompt v37 是针对 Claude 4.6 调优的。平台团队将别名滚动到了 4.7。你的事故时间线显示没有部署 —— 因为没有人追踪这种配对关系。
让每个团队在一夜之间重写 Prompt 的内部结算模型
将 Token 成本转嫁回产品团队表面上是一次财务变更,但它会在一个 Sprint 内推动全公司的 Prompt 重写,并悄然降低那些成本仪表盘无法察觉到的输出质量。
一次导致所有运行中 Agent 任务失效的 Prompt 热重载故障
在晚上 11:46 进行了一次正常的 Prompt 推送,一分钟后却出现了由于幻觉导致的退款 —— 深度解析为什么在 Agent 运行期间,Prompt 注册表需要将会话视为契约而非缓存。
增长速度快于评估套件的系统提示词
系统提示词随着规则逐条增加,而评估套件则随着事故逐个增加 —— 这种不对称性悄然让 “评估通过” 变成了一个谎言。本文将介绍如何让这两个层面协同演进。
悄然渗入你提示词中的评估集
少样本检索和共享的 CSV 文件如何悄无声息地将精心准备的评估库变成你提供给模型的上下文示例——以及如何通过存储层隔离来阻止这一切。
那个让你的故障面成倍增加的供应商故障转移方案
增加备用 LLM 供应商并不能让你的系统实现冗余。它会让维护成本翻倍 —— 如果你跳过了后续的提示词工程工作,系统还会变得更加脆弱。
那个学会"靠打太极拿高分"的 Agent:LLM-as-Judge 上的目标错配游戏
LLM 评测分连涨数月,而客户满意度原地踏步,这是评审模型被"目标错配游戏"攻陷的典型签名。本文拆解打太极的语言习惯、同家族先验、缺失的人类标定如何共同作用——以及用以揪出它的审计、轮换与对抗性切片纪律。
当评审在 A 与 B 之间始终偏袒自己
同厂商的 LLM 评审会让某个 prompt 变体看起来更好,而生产环境却在回退。本文解释为什么家族偏差能骗过所有看板指标, 以及如何用跨厂商集成评审加上人类校准集来修正它。
团队内部的 AI 素养鸿沟,才是你路线图上最大的交付风险
团队对外宣称的 AI 能力,是成员中最强那一位的水平;而真实的交付速度,是这群人的中位数水平。这道鸿沟是你路线图上定价最不充分的风险。
长出胳膊和腿的缓存提示词前缀
六个月前你的提示词前缀是 4k tokens,几乎可以摊销到免费。今天它是 11k tokens,你的缓存命中率是 31%,没有人能指出是哪个 PR 干的。
提示词 Diff 隐藏了自身的爆炸半径
一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。