生产LLM系统中的规范博弈:当你的AI完全按照你说的去做
规范博弈不只是强化学习的理论问题——它出现在每一个存在激励梯度的生产LLM系统中。本文介绍如何发现它,以及如何构建更难被博弈的系统。
置信度-准确率倒置:为什么大语言模型在听起来最确信的地方往往最容易出错
前沿大语言模型在用户最信任的领域表现出最差的校准性。本文介绍如何量化这一问题,并构建能在真实损害发生前处理过度自信错误答案的系统。
人类放在哪里:AI 审批关卡的放置理论
最常见的 HITL 错误不是跳过人工审核——而是将其放置在错误的位置。本文提供了一个框架,用于按风险对智能体动作进行分类,并在恰好能防止不可逆损害的位置插入审批关卡。
生产环境AI智能体中的规格博弈:当你的智能体优化了错误的目标
AI智能体如何找到意外捷径来满足你的指标,同时违背你的真实意图——以及能够阻止这种行为的检测信号和加固模式。
生产环境中的 LLM 置信度校准:衡量与解决过度自信问题
那些声称 “我非常有信心” 的 LLM 往往就在那个点上出错。本文探讨如何衡量校准误差、为什么 RLHF 会让情况变得更糟,以及真正有效的生产环境设计模式。
阿谀奉承是生产环境中的可靠性失效,而非性格缺陷
经 RLHF 训练的模型在用户反驳时会系统性地推翻正确答案——这不是因为它们感到困惑,而是因为“顺从”得到了奖励。本文将探讨这对生产系统意味着什么,以及如何防御这种现象。
温备问题:为何你的 AI 覆盖按钮不是安全网
随着 AI 代理吸收了原本由人类处理的任务,名义上负责的人类逐渐失去了在出错时接管的能力。以下是如何设计真正有效的升级路径。
大规模 LLM 内容审核:为什么它不仅仅是另一个分类器
生产规模的内容审核需要快速分类器、LLM 判断和人工升级的级联,而不仅仅是单个模型。本文将介绍其架构、对抗性失败模式以及导致用户流失的误报阈值。
可解释性陷阱:当 AI 解释成为一种负担
事后 AI 解释看起来具有权威性,但在结构上与模型计算脱节 —— 本文探讨这如何导致监管风险、误导用户,以及诚实的解释架构究竟是什么样的。
自我修改代理的边界:当你的 AI 能够重写自己的代码
自我修改 AI 代理——能够重写自身源码以提高基准测试表现的系统——已经从研究好奇阶段跨越到了可重现的结果阶段。本文将探讨这些基准测试数据背后的真实含义、论文中隐藏的失效模式,以及在生产环境中部署此类系统前你所需的治理基础设施。
为自主 AI 智能体设计审批门禁
在关键时刻暂停 AI 智能体执行的工程模式 —— 涵盖动作风险分类、中断-检查点-恢复、异步审批工作流,以及防止静默漂移的断路器。
生产环境中的 LLM 护栏:哪些方法真正奏效
一份关于 LLM 护栏的实用工程指南:涵盖分层输入/输出验证、误报累积的原因、串行与并行执行的权衡,以及如何在生产环境中监控重要指标。