当 LLM 评审 LLM 时,错误被“洗白”而非被捕获
在一个由一个模型评审另一个模型并反馈给下一次评估的闭环中,根本不存在地面真值(ground truth)——错误被“洗白”成了高分。这里介绍了该在何处重新引入人工。
“无助但安全”的失败:为什么拒绝率是错误的安全性指标
拒绝率看起来像是一种安全控制手段,但将其视为唯一指标会导致交付出的模型虽然礼貌且符合审计要求,却会被用户抛弃。本文将探讨为什么过度拒绝在生产环境中难以察觉,套话和直接拒绝如何影响留存率,以及如何使用双轴评分标准而非单一的二元标准来评估拒绝行为。
强制一致性偏见:当模型将你的意图向分布众数取整时
经过对齐的大模型会悄悄地将不寻常的请求向训练分布的众数取整。本文将探讨为什么标准评估会忽略这一点,以及捕捉这一现象的离模态约束方法。
在 AI 功能感觉准备好之前就发布它
为什么最初的 500 名真实用户产生的可操作信号,比再花四周调优提示词更多——以及如何设计一个能获取这些信号而不损害信任的早期访问计划。
当 LLM 为自己批改作业:打破 AI 评估中的反馈循环
LLM 生成的评估集创建了一个反馈循环,导致模型偏见被编码为事实标准 (Ground Truth)。以下是打破该循环的污染信号、跨模型验证策略以及人工采样规范。
评估债务棘轮:靠感觉发布 AI 功能的团队如何被技术欠账所困
在发布 AI 功能时跳过评估会产生复利式的债务,使团队陷入无法测试的行为困境。本文探讨棘轮效应的运作机制,以及如何在不暂停功能开发的前提下偿还这笔欠账。
置信度描述而非评分:为什么 0.87 的徽章无法打动任何人
一个 0.87 的置信度徽章不会改变任何用户行为。而一个说明模型未检查内容的自然语言对冲表述则能起到很大作用。本文探讨了为什么概率评分是错误形式的信号,以及如何将不确定性作为内容而非 UI 叠加层来发布。
反事实日志:通过今天的充足记录,在明年的模型上重放昨天的流量
生产环境中的 LLM 日志能很好地回答“模型说了什么”,却难以回答“模型看到了什么” —— 正是这种差距导致了数月后的模型迁移评估宣告失败。本文介绍了一种用于可重放追踪的实用模式。
当你的评测结果不一致时:在数据互相矛盾时的一套信号优先级体系
对于提示词变更,四种不同的评测信号很难完全一致。如果没有一套明确的优先级体系来规定在何种情况下以哪个信号为准,那么每个发布周都会变成一场关于“该信任谁的数据”的争论。
AI 审查 AI:代码审查智能体的非对称架构
当作者和审查智能体共享同一个基础模型时,代码审查就变成了一种信心放大器,而非质量关卡。本文探讨如何通过非对称架构、多轮批评者(multi-pass critics)和评估纪律,将 AI 审查转化为真实有效的信号。
辩论多样性坍塌:当三个智能体投出 3-0 只因它们读过同样的互联网
多智能体 LLM 委员会经常投出 3-0 的票数,并非因为答案正确,而是因为前沿模型共享了先验知识。本指南将教你如何衡量辩论多样性坍塌,并设计出真正能产生分歧的集成系统。
确认与行动间的鸿沟:智能体的“明白了”并不等同于承诺
生产环境中的智能体经常自信地确认那些从未执行的操作,这是因为开发团队将对话文本误认为是契约,而非工具调用。本文介绍一种将叙述与承诺分离的设计模式。