多模型一致性:当你的流水线中的连续 LLM 调用相互矛盾时
在单个工作流中,三次 LLM 调用可能会产生相互冲突的事实、实体引用和状态声明。本文将介绍如何设计能够保持连贯性的流水线。
Prompt 金丝雀部署:像资深 SRE 一样发布 Prompt 变更
Prompt 修改与代码部署一样危险 —— 但几乎没有人以这种方式对待它们。本文介绍了流量切分、质量监控和回滚纪律,这些实践将那些能在用户发现之前捕获性能退化的团队,与那些通过 Twitter 才知道出问题的团队区分开来。
提示熵预算:将输出方差作为生产环境的核心指标
大多数生产环境的 LLM 系统只追踪准确率,却忽视了方差。衡量相同输入的输出分布——即提示熵预算——是决定用户体验一致性的缺失指标。
LLM Agent 的重试预算:为什么 20% 的单步失败率会让你的 Token 账单翻倍
在链式 LLM Agent 中,20% 的单步重试率很少只增加 20% 的成本 —— 由于上下文回放,成本往往会攀升至 2 倍左右。本文将介绍如何通过预算限制重试、在 CI 中捕获成本爆炸,并停止为失败支付双倍费用。
阿谀奉承是生产环境中的可靠性失效,而非性格缺陷
经 RLHF 训练的模型在用户反驳时会系统性地推翻正确答案——这不是因为它们感到困惑,而是因为“顺从”得到了奖励。本文将探讨这对生产系统意味着什么,以及如何防御这种现象。
委托悬崖:AI 代理可靠性为何在 7 步以上崩溃
AI 代理在演示中令人印象深刻,但在生产环境中的失败率却高得惊人。本文揭示了随着任务长度增加可靠性崩溃背后的数学原理,以及你实际上能做些什么。
温和交接模式:设计智能体与人类之间的流畅控制权转移
大多数智能体升级流程都是冷转接——在边界处丢弃所有先前上下文。温和交接模式将智能体与人类的控制权转移视为一个状态打包问题——结构化载荷、混合主动控制分配,以及真正有效的恢复协议。
长期运行 AI 智能体中的上下文毒化
长期运行的 AI 智能体中积累的上下文是如何默默地破坏推理能力的,导致该问题的四种故障模式,以及防止级联故障的检查点、剪裁和不变性检查模式。
HITL 橡皮图章问题:为什么"人在回路"往往两者皆非
大多数人在回路的实现并没有产生监督效果——它们只是产生了文书工作。以下是审查者停止审查的原因,以及在规模化场景下保持HITL真实有效的设计模式。
AI 功能的延迟预算:当核心组件是随机的,如何制定并达成 p95 SLO
LLM 延迟与数据库延迟的行为截然不同。本文介绍如何为 AI 功能制定切实可行的 p95 SLO、分解延迟预算,并利用对冲、流式传输和推测执行真正达成这些目标。
供应商可靠性陷阱:你的 LLM 供应商 SLA 已成为你用户的 SLA
你对外宣称 99.9% 的正常运行时间,但你的关键路径却依赖于一个只有 99.5% SLA 的 API——而供应商故障往往集中发生在流量高峰期。以下是在故障找上门之前弥合差距的方法。
运营模型卡:实验室不发布的部署文档
已发布的模型卡告诉你模型是否安全——但不会告诉你它能否满足你的p95 SLA、在什么上下文长度下性能会下降,或者它产生格式错误JSON的频率。这里是构建你真正需要的部署文档的测试套件。