Best-of-N 是一种架构,而不仅仅是打榜技巧
在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。
爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
Token FinOps:将 AI 支出归因到具体功能
你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。
当硬件说谎时:静默数据损坏遇上随机性软件
大约每千个加速器中就有一个会静默地计算出错误答案,而 LLM 推理是第一个硬件故障与采样噪声看起来完全一致的大规模工作负载。本文将探讨位翻转如何隐藏在随机输出中,以及如何利用金丝雀通道和单机统计数据来捕捉说谎的 GPU。
你在廉价模型上测试,却在昂贵模型上部署
在廉价模型上运行 CI 和评估,而生产环境却使用尖端模型,这在最关键的地方破坏了开发与生产环境的一致性。本文将探讨为什么层级差距会使你的评估门控失效,以及缩小这一差距的预算计算方法。
让所有模型都变得平庸的抽象层
多供应商 LLM 网关承诺可以通过一行代码切换模型,但却悄无声息地剥离了提示词缓存、模式强制执行和推理控制——而这些正是决定成本和质量优势的核心功能。本文将探讨何时值得支付这种“可移植性税”,以及如何利用“逃生舱”模式回归供应商原生功能。
批处理层级是 AI 时代的竞价实例
你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。
黑板模式回归:1980 年代的 AI 如何处理多智能体协作
通过共享计划文件进行协作的智能体团队正在重新发现 20 世纪 70 年代的黑板架构 —— 但他们只重建了白板,却遗忘了让其发挥作用的调度器、置信度评分和层级结构。
编译器是你运行过最廉价的评估 (Eval)
你的语言选择决定了智能体是能在每次编辑时获得一个免费、即时且确定性的验证器,还是将类型错误推迟到昂贵的评估套件和运行时的意外中。模型编写代码的方式如何重构了团队在十年前确定的技术栈权衡。
崩溃是承重性的:大语言模型 (LLM) 的容错性如何掩盖了破碎的数据契约
流水线曾通过崩溃来强制执行数据契约。然而,作为消费者的 LLM 却能应对畸形的输入,从而将明显的故障转变为无声的质量下降 —— 本文将介绍如何通过验证门和金丝雀断言来恢复告警机制。
合并队列成了新的瓶颈
编程代理让你的 PR 数量翻了一番,但合并过程仍像是在为人类打字速度设计的队列中缓慢爬行。本文将探讨合并队列拥堵背后的容量计算逻辑、为什么不稳定测试会在代理规模下产生连锁反应,以及分层预合并/合并后测试如何恢复吞吐量。
模型 API 现已成为 Tier 0 级别。在状态页变红之前,请先设计好降级模式
模型 API 位于请求路径中,与数据库同等重要,但大多数灾备 (DR) 计划仍将其视为“锦上添花”。这份实用指南涵盖了降级模式 —— 缓存、前置版本、队列和诚实的停机 —— 以及在下一次供应商故障发生前需要做出的业务决策。