智能体输出的验收抽样:制造业质量保证领先于代码审查的秘诀
智能体每周交付数百个 PR,而其中大多数完全没有经过审查。制造业在一个世纪前就通过验收抽样解决了这个问题——利用 AQL 表、批次拒收和转移规则,将对智能体的信任从“凭感觉”转变为明确且可衡量的制度。
当算力编写代码时的员额规划
年度规划仍然是将路线图的野心转化为招聘需求,但在一个重度使用智能体的组织中,产出的边际单位是 Token 加上审查带宽。本文探讨如何评估吸收能力、规划推理预算,并制定一份让招聘与算力为同一目标展开竞争的计划。
技能是过程性知识的包管理器
RAG 检索事实,但过程性知识必须完整加载或根本不加载。为什么 Agent 技能的表现类似于包生态系统 —— 以及为什么你的操作手册现在需要版本控制、测试、代码审查和负责人。
批处理层级是 AI 时代的竞价实例
你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。
脚手架审计:每一次模型发布都让你的部分开发框架变成累赘
重试机制编排、JSON 修复解析器以及强制思维链,都是为你不再运行的模型而构建的。这是一套在每次模型升级时,对过时的 LLM 脚手架进行标记、消融和删除的实用规范。
你的错误信息现在成了 Prompt:为 AI Agent 编写失败输出
AI Agent 阅读你的堆栈跟踪和 CLI 错误信息的频率远高于人类 —— 并且它们会将这些信息当作指令来执行。如何编写能让重试循环趋于收敛的错误信息,而不是让成群的 Agent 陷入失控的螺旋。
资历倒置:为什么当 Agent 加速时,你的资深工程师反而变慢了
Agent 让代码生成变得廉价,却让审查变得昂贵。成本落在了唯一无法扩展的资源上:资深工程师的判断力。本文探讨了负载为何会向他们集中,以及如何重新平衡。
代理墙钟预算:一场与工具超时机制的赛跑
在代理技术栈内部,代理的时钟与工具的时钟几乎从未共享同一个零时刻 (t-zero)。当它们的预算发生偏差时,一个耗时 8 秒的工具调用可能会撞上 7.9 秒的截止期限,导致框架针对一个它从未见过的“成功”结果进行重新规划。
当用户取消对话后,下游 API 却仍在继续写入
点击停止按钮可以干净地关闭 LLM 流。但这并不会停止工具已经向第三方开启的 HTTP 请求,而第三方并不知道对话已经结束。本文将解释为什么 AbortSignal 止步于套接字,以及你应该在提交边界构建什么来替代它。
那些你的团队遗忘在后台且正使用生产环境凭据运行的 MCP 服务器
在一个运行着 CI 级别 OAuth 令牌的开发人员笔记本电脑上,MCP 服务器就是一个生产环境的攻击面。本文将揭示 DNS 重绑定、错误的绑定以及共享令牌是如何将一个被攻陷的浏览器标签页演变成部署密钥泄露的。
供应商将你的模型标识符重定向到特定租户的微调模型,而其他人使用的却是基础模型
如果将 LLM 模型标识符视为权重的名称而非路由决策的标签,那么供应商可能会在评估套件仍保持“绿色”通过状态时,静默地将你的租户从微调模型切换回基础模型,导致客户最先察觉到问题。
当 On-Behalf-Of 悄然变成 Act-As:你的智能体继承的 OAuth 作用域陷阱
一个持有用户形态 OAuth 令牌的 AI 智能体正在冒充该用户,无论安全审查如何称呼它。提示词注入是如何将这一间隙演变为安全事件的,以及修复该问题的令牌级模式。