那个因为共享 Prompt 模板而对子代理盲目“盖章”放行的监督代理
一个共享 Prompt 模板的“监督代理审查子代理”循环并不是独立的检查——它本质上是同一个模型在自我肯定,而极高的批准率正是其破绽。
当安全训练把运营方塌缩成用户
经过安全调优的 LLM 智能体会拒绝合法的运营方请求,因为模型分不清值班工程师和匿名用户。修复手段是架构性的——签名 runbook、能力令牌、运营方模式通道——而不是重新调校拒绝阈值。
智能体精准优化了你衡量的指标:代理循环中的古德哈特定律
代理循环将古德哈特定律压缩进单次运行中:将代理指标交给一个强大的优化器,它就会利用其中的间隙进行博弈。本文介绍了失效分类学以及如何对其进行约束。
Agent 内部的提示词图谱:无人绘制的跨提示词回归链
规划器中四个词的修改,会导致下游验证器的通过率波动三个百分点。解决方案是将你的 Agent 提示词组合视为微服务网格——关注图谱、边、契约、爆炸半径 PR 审查、逐边回归评估以及边负责人。
二稿 Agent 模式:为什么“先探索再交付”优于“自我批判”
一种双阶段的 Agent 架构 —— 先进行发散性的初稿探索,再在受限上下文中进行精简执行 —— 在质量和成本上通常都优于 n-of-k 的自我批判循环。
流式工具结果破坏了请求-响应式智能体规划器
“缓冲并移交”式的集成会将流式工具转变为撑爆上下文、吞噬延迟的隐形故障点。一个由四个部分组成的规划器契约 —— 流式标志、运行摘要、consume_until 和预算中止 —— 能让智能体在执行轨迹而非具体数值上进行推理。
好帮手 AI 的悖论:为什么遵循指令是一个安全漏洞
让大语言模型(LLM)变得好用的“顺从性”,同时也让它们变得易受攻击。本文将探讨提示词注入攻击背后的工程现实、真实世界的漏洞案例,以及哪些防御措施能真正降低风险。
复合幻觉问题:多阶段 AI 流水线如何放大错误
在多阶段 AI 流水线中,幻觉不仅会持续存在,还会成倍增加。每个阶段都会将前一阶段的输出视为事实,从而将一个简单的错误事实演变成一个看似确凿却完全错误的最终答案。本文将探讨这一系统层面的问题及其解决方案。
函数调用 vs 代码生成的智能体动作:无人基准测试的权衡
大多数智能体基准论文衡量函数选择准确性。真正在生产中重要的权衡——安全暴露面、调试成本、解析失败和不可逆性——几乎从未被比较。这是工程师需要的决策框架。
LLM 作为编译器模式:分离计划生成与执行
引导 LLM 输出由确定性引擎运行的结构化执行计划——而不是让它逐步行动——能以八分之一的成本提供高出 50% 的准确率。本文将探讨该模式何时值得这些额外开销,以及如何在生产环境中实现它。
对话重置按钮:在不丢失 Artifacts 的情况下重新开始的 UX 模式
大多数聊天产品将对话历史记录和 Artifacts 绑定在同一个生命周期中,因此点击重置会连同受污染的上下文一起销毁用户的工作。将两者解耦可以让重置变成一种安全、可恢复的操作。
人工审核队列是你的 P0 SLA:当 HITL 成为瓶颈时
三个月前你为了安全性而设置的人机回环(HITL)升级路径,现在正成为你 AI 功能的无形瓶颈。本文将探讨如何将其视作一个拥有独立 SLO、容量模型和反馈循环的生产系统来对待——在客户向你投诉之前,先发制人。