Token 预留容量:被人们忽略的、尚未从云时代迁移过来的预留实例决策
预置吞吐量和承诺使用折扣让你能像以前预留 EC2 一样预留 LLM 推理资源 —— 但盈亏平衡点比你想象的要高,而且你的承诺可能会因为模型弃用而陷入困境。这里是移植过来的实战手册,以及其中一个危险的变数。
爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
学习型系统的任意时间点恢复:那个没人做的备份
你的数据库有快照,代码有 git,但你的智能体大脑却分散在五个独立版本化的存储库中。为什么对于大多数智能体技术栈来说,“恢复到昨天下午 3 点”是一个无法定义的概念,以及存储工程中的一致性组(consistency-group)规范如何解决这一问题。
当硬件说谎时:静默数据损坏遇上随机性软件
大约每千个加速器中就有一个会静默地计算出错误答案,而 LLM 推理是第一个硬件故障与采样噪声看起来完全一致的大规模工作负载。本文将探讨位翻转如何隐藏在随机输出中,以及如何利用金丝雀通道和单机统计数据来捕捉说谎的 GPU。
让所有模型都变得平庸的抽象层
多供应商 LLM 网关承诺可以通过一行代码切换模型,但却悄无声息地剥离了提示词缓存、模式强制执行和推理控制——而这些正是决定成本和质量优势的核心功能。本文将探讨何时值得支付这种“可移植性税”,以及如何利用“逃生舱”模式回归供应商原生功能。
批处理层级是 AI 时代的竞价实例
你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。
内部容量市场:在团队间分配稀缺的推理资源
当多个团队共享同一个推理池时,一个团队的评估扫描(Eval Sweep)可能会使另一个团队的生产环境对话系统陷入饥饿。借鉴大型机分时系统和 Borg 的优先级波段:本文将探讨优先级层级、抢占、费用回填,以及团队在何时应当获得专用容量。
模型 API 现已成为 Tier 0 级别。在状态页变红之前,请先设计好降级模式
模型 API 位于请求路径中,与数据库同等重要,但大多数灾备 (DR) 计划仍将其视为“锦上添花”。这份实用指南涵盖了降级模式 —— 缓存、前置版本、队列和诚实的停机 —— 以及在下一次供应商故障发生前需要做出的业务决策。
预热沙箱池:当每个智能体任务都拥有专属机器时的基础设施经济学
单任务智能体隔离悄然将你的平台转变为一个临时虚拟机集群。真正的工程挑战在于预热池、快照流水线、感知时长的装箱策略以及回收废弃沙箱 —— 而你过去的容器经验可能会误导你。
在构建下一层 AI 技术栈之前,请先绘制 Wardley 地图
关于 AI 基础设施的‘自研还是外购’的争论,往往假设了一个并不存在的稳定格局。Wardley 地图揭示了你的技术栈中哪些层会在几个月内商品化,以及哪些组件(如领域评估和私有数据)正朝着相反的方向发展。
你的智能体是一个“话唠”客户端:数据引力开始影响工具循环
AI 智能体在处理每个任务时会进行数十次串行工具调用。当推理和数据位于不同的云端时,延迟和出站流量费用将成为主要成本。N+1 查询问题又回来了 —— 只是上升了一个层级。
你的 AI 工作负载也有“夜晚”:批处理折扣是对架构的考验
每一个主要的供应商都通过批处理 API 以半价销售同样的 token,但大多数团队从未获得过这一折扣,因为他们从未对哪些推理调用确实需要即时响应进行过分类。本文介绍了一个延迟分道(latency lanes)框架、批处理所需的架构重构,以及为什么 50% 的折扣是结构性的。