重新规划而非重试:为什么大多数智能体错误并非瞬时性的
大多数智能体框架在工具错误时默认使用指数退避重试 —— 这种模式借用自无状态的 HTTP,但在有状态的规划循环中是完全错误的。正确的默认做法应该是重新规划。
采样参数继承:当 0.7 的温度从规划器泄露到验证器时
将温度沿调用树向下传播的智能体框架,会将规划器的创意旋钮变成验证器的 Bug。本文探讨了基于角色的采样配置文件、默认拒绝继承,以及捕获此类泄露的分歧率评估。
AI 功能指标陷阱:为什么 DAU 和留存率在随机化表面 (Stochastic Surfaces) 上会产生误导
DAU、转化率和留存率是为点击流设计的。而 AI 功能产生的是任务弧 (Task Arcs) —— 请求、响应、后续、解决 —— 你从确定性策略指南中引入的仪表盘会告诉你该功能表现优异,但实际上用户正在绕过它。
你的 stop_reason 在说谎:构建生产环境故障排查真正需要的停止分类法
厂商提供的 stop_reason 值只给了你四个分类,但生产环境的故障排查通常需要八个。本文将介绍如何构建并行停止分类法,将黑盒式的终止转换为可调试的信号。
流式 JSON 解析器:Token 与类型化对象之间的鸿沟
JSON.parse 是全量或全无的,但 LLM 的 Token 流并非如此。为什么流式结构化输出是 API 和 SDK 必须共同解决的设计难题,以及一个真正的部分解析器必须具备哪些功能。
并行工具扇出的结构化并发:谁来负责部分失败?
大多数智能体框架将并行工具调用作为分离的 goroutine 运行,然后重新发现了结构化并发在二十年前就已经解决的失败模式 —— 部分失败、响应取消以及成本失控。
系统提示词作为代码、配置或数据:影响全局的架构决策
大多数团队在选择系统提示词的存储位置时非常随意,随后却要在数年内为此承担后果。在代码、配置和数据存储之间的选择会直接影响部署频率、评估范围和租户灵活性 —— 这里有一套在 MVP 阶段前就应应用的框架。
Tokenizer Churn:你的“兼容”模型升级中隐藏的破坏性变更
供应商的模型升级可能会在保持 API 字节级稳定的同时,悄悄更换底层的 tokenizer —— 从而在无形中破坏上下文预算、停止序列和 few-shot prompt。本文将介绍如何审计、固定以及在 tokenizer churn 中生存。
拒绝还是上报:置信度门控 AI 中的双阈值问题
单个置信度阈值将“拒绝”和“上报”这两个截然不同的决策强行合并为一个数字,而这种妥协正是导致你的信任度指标持续下滑的原因,即便在准确率看起来还不错的情况下也是如此。
供应商可迁移性税:为什么“我们可以更换模型”是每季度的成本项,而非一个勾选项
跨 LLM 供应商的行为可迁移性在你停止投入的那一刻就开始衰减。本文分析了每季度的资金消耗——评估订阅费、基于模型的提示词路由、合约议价权——这些因素让“我们可以更换模型”从 PPT 上的愿景变成了现实中的可选项。
你的模型更新是一次破坏性变更:你欠集成商的“行为变更日志”
当厂商静默发布一个微小的模型更新时,每一个下游提示词都变成了一个无人遵守的契约 —— 本文将探讨行为变更日志应该包含什么,为什么没有人发布它,以及消费者在等待期间应该部署哪些监控手段。
推理预算委员会:Token 支出突破七位数时的治理之道
探讨工程团队如何在 Token 支出达到七位数门槛时进行治理:包括容量池、基于结果的费用分摊以及负责分配这些资源的委员会。