当 LLM 评审 LLM 时,错误被“洗白”而非被捕获
在一个由一个模型评审另一个模型并反馈给下一次评估的闭环中,根本不存在地面真值(ground truth)——错误被“洗白”成了高分。这里介绍了该在何处重新引入人工。
像入职初级工程师一样入职 AI 智能体是一种范畴错误
初级工程师每周都在积累上下文;而智能体则一无所获。为什么“新员工”这一比喻会分散你的注意力,以及你应该将学习重心放在何处。
权限提示是一个 UX Bug:当“人在回路”沦为“人工橡皮图章”
智能体产品将危险操作锁定在审批对话框之后并称之为监管,但到了第 40 次提示时,人类会出于条件反射点击批准。为什么提示量才是真正的安全 Bug,以及如何修复它。
Prompt Caching 的隐形代价:当缓存命中提供错误的用户上下文时
Prompt 缓存键是一个正确性边界,而非一个计费开关。如果你只为了提高命中率而设计它,就会引发跨租户上下文泄露和过时的个性化。
Prompt Injection 是混淆代理问题,而非内容过滤问题
将 Prompt Injection 视为内容过滤问题是一场注定失败的军备竞赛。真正的漏洞在于“混淆代理”:即智能体利用借来的权限执行来自不可信渠道的指令。解决方案应当是限制其能力范围。
每次事故后你的系统提示词都会增长 —— 而且没人会删掉任何一行
每一个生产事故都会在你的系统提示词中留下一句防御性语句,而且从来没人会删掉它们。本文将探讨为什么提示词积聚是真实的技术债,以及如何通过日期标记、半衰期和消融实验来修剪它。
任务完成率指标变绿,而用户却在默默受苦
94% 的任务完成率仪表板可能一直显示绿色,但与此同时 Agent 正在消耗大量 Token、反复回溯并让用户感到疲惫。为什么完成率是一个错误的指标,以及四个能洞察其盲点的轨迹指标。
那个记得你撤回了什么的智能体:将删除作为一等公民的记忆操作
只增(append-only)的智能体记忆存储在存储的事实失效的那一刻就开始腐烂。为什么删除、撤回和失效必须是一等公民操作 —— 以及如何设计可被查找、反驳和移除的记忆写入。
Token 预算是调度问题,而非提示词问题
当一个冗长的工具结果耗尽上下文窗口时,智能体的质量就会下降。应像对待操作系统内存一样对待 Token 预算:设置上限,按优先级淘汰,并为推理留出空间。
工具的默认参数其实是伪装的策略决策
你的 Agent 跳过的每一个可选参数都会继承你选择的默认值。这些默认值是未经审计的策略 —— 它们在追踪中不可见,在评审中也无人负责。
你在没告诉智能体的情况下修改了工具 Schema
重命名一个字段对你的后端来说只是常规的 API 变更,但对于调用该工具的 LLM 而言,这却是一个无声的破坏性变更。本文探讨如何将工具 Schema 视为拥有两个消费者的版本化契约。
原本运行良好的工具,直到两个智能体同时调用它
智能体工具通过了单调用者测试,但在第二个智能体出现的那天崩溃了。本文将探讨为什么并发漏洞在结构上对串行评估是不可见的,以及幂等性、锁定和负载测试如何修复这些问题。