并行工具扇出的结构化并发:谁来负责部分失败?
大多数智能体框架将并行工具调用作为分离的 goroutine 运行,然后重新发现了结构化并发在二十年前就已经解决的失败模式 —— 部分失败、响应取消以及成本失控。
Token 放大:烧掉你账单的提示词注入攻击
大多数提示词注入威胁模型都集中在数据泄露上。更隐蔽的一类攻击是账单放大 —— 0.01 美元的请求变成了 40 美元的推理发票。这里是阻止该攻击的防御准则。
Tokenizer Churn:你的“兼容”模型升级中隐藏的破坏性变更
供应商的模型升级可能会在保持 API 字节级稳定的同时,悄悄更换底层的 tokenizer —— 从而在无形中破坏上下文预算、停止序列和 few-shot prompt。本文将介绍如何审计、固定以及在 tokenizer churn 中生存。
你的工具目录遵循幂律分布,而你却在针对长尾进行优化
生产环境中的工具使用遵循幂律分布,但大多数 Agent 框架都将工具目录视为扁平结构,并为此付出了代价:Token 膨胀、工具数量超过 100 个时的准确度崩塌,以及隐性的长尾回归。这是一份关于热/冷分区的实战指南。
工具组合提权:你的安全审查清理了节点,而非边缘
针对单个工具的安全审查清理了节点,但智能体运行的是轨迹。智能体工具目录的组合图是一个安全团队从未枚举过的权限集,而混淆代理攻击就存在于这些边缘之中。
拒绝还是上报:置信度门控 AI 中的双阈值问题
单个置信度阈值将“拒绝”和“上报”这两个截然不同的决策强行合并为一个数字,而这种妥协正是导致你的信任度指标持续下滑的原因,即便在准确率看起来还不错的情况下也是如此。
供应商 99.9% 的 SLA 对你的 Agent 来说衡量边界错了
供应商 99.9% 的可用性是按单次调用衡量的;而你的 Agent 每个任务需要进行 12 次调用。本文将探讨其中的算术逻辑、缺失的合同条款,以及如何在用户察觉之前捕获故障的发散告警。
你的智能体发件箱将是你的下一个送达率事故
一个智能体在早餐前发出了 80,000 封邮件,导致重置密码域名的声誉在六周内荡然无存。在第一次发送之前,你需要建立子域名、DKIM 和速率限制的纪律。
为什么 AI 生成的注释腐烂得比代码还快
AI 智能体为每个函数生成流利的文档字符串,它们往往只是在转述代码逻辑,而非编码意图。一旦代码发生变动,注释就会说谎——而下一位读者往往会相信谎言而非代码。这是一套面向 AI 辅助时代的代码审查规范。
AI 审查 AI:代码审查智能体的非对称架构
当作者和审查智能体共享同一个基础模型时,代码审查就变成了一种信心放大器,而非质量关卡。本文探讨如何通过非对称架构、多轮批评者(multi-pass critics)和评估纪律,将 AI 审查转化为真实有效的信号。
你的 API 曾假设一次只有一个人类用户。并行智能体打破了这一契约。
内部 API 是为人类节奏的会话而设计的。当用户生成并行智能体时,速率限制、幂等性假设、审计日志架构和 CSRF 流程都会瞬间失效。
推理 Span 中缺失的 kWh 列:单次请求的碳归因
可持续性披露正从企业层面的汇总转向产品层面的细分。如果工程团队只测量每个 token 的成本而不测量每次请求的能耗,他们很快会发现自己构建的仪表盘解决的是错误的问题。