Best-of-N 是一种架构,而不仅仅是打榜技巧
在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。
变成关键路径的审批队列
当你在 Agent 和不可逆的操作之间加入人工环节时,你增加的并不是一个安全原语。你增加的是一个具有吞吐量限制、可用性配置以及质量与负载曲线的队列。本文将探讨它是如何演变成一个无人预定义的 P0 级问题的。
那个悄然演变成延迟敏感型服务的夜间批处理作业
随着一个又一个合理需求的加入,一个夜间批处理作业最终演变成了对延迟要求极高的服务。本文将探讨为什么批量推理和在线推理的优化目标截然相反,架构漂移如何导致隐蔽的故障,以及如何有针对性地进行重新架构。
Token 预算是调度问题,而非提示词问题
当一个冗长的工具结果耗尽上下文窗口时,智能体的质量就会下降。应像对待操作系统内存一样对待 Token 预算:设置上限,按优先级淘汰,并为推理留出空间。
你的智能体假设存在的“撤销”按钮
AI 智能体在规划时往往假设每个动作都是可以撤销的,这是在可逆的代码沙盒中养成的习惯。通过在工具中编码可逆性分级,确保“单向门”决策的安全性。
当升级请求无人响应时:人机回环是一个人员配置问题
人机回环(Human-in-the-loop)的前提是有人响应升级请求。在生产环境中,这是一个包含到达率、服务时间和放弃率的队列——而无人响应的升级请求比没有升级请求更糟糕。
人工接管作为一等功能:设计能够优雅降级至人工控制的 AI 系统
大多数 AI 系统将人工接管视为错误状态,而非设计模式。以下是如何将接管协议构建为一等操作路径而非事后补救的方法。
系统提示中的冲突指令:无人负责的隐性故障模式
系统提示通过拉取请求不断增长,积累相互冲突的指令,并以不可预测的行为漂移形式表现出来。本文介绍如何检测矛盾并构建能够经受变更的提示架构。
AI 原生 API 设计:构建智能体真正能调用的后端
REST API 是为人工编写的客户端设计的。AI 智能体会以完全可预见的方式破坏它们——幻觉出端点名称、在没有幂等性的情况下重试、忽略稀疏的错误信息。本文介绍如何构建智能体能够可靠调用的后端。
人力瓶颈问题:当人机协作成为你系统中最慢的微服务
人机协作审核通常是正确的安全设计——直到你的审核人员成为系统中最慢的微服务。本文是一份关于队列设计、多信号路由和 SLO 的实用指南,旨在确保在大规模场景下人工监管依然具有实际意义。
群体提示问题:为什么你的系统提示对80%的用户有效,却悄然让另外20%的用户失望
系统提示是为想象中的中位用户编写的,但生产流量是一个分布。以下是如何找到那20%被你的提示悄然失败的用户——以及应对方法。
AI 降级设计是架构问题,不是事后补丁
大多数 AI 功能只为顺利路径而设计。降级方案往往在第一次生产事故后才被临时拼凑——如果有的话。以下是如何在写第一个 prompt 之前就把这个问题解决掉。