间接提示注入:你以为处于惰性的数据平面
你的智能体将检索到的每个文档都视为惰性数据,但检索到的文本实际上是以系统提示词的权限运行的。本文将探讨间接提示注入的工作原理、为什么 EchoLeak 证明了它的存在,以及真正有效的防御手段。
你的 RAG 语料库信任边界取决于谁能写入其数据源
通过竞争对手公开评论进行的间接提示词注入,可以将你的 RAG 管道变成一个数据外泄通道。信任边界不在于谁编写了摄取代码,而在于谁可以写入数据源。
绕过清理器的提示词注入:当智能体通过工具读取恶意指令
输入清理器位于用户和模型之间,但使用工具的智能体还有数十种其他的摄入路径。本文将探讨为什么检索到的文档、网页抓取、MCP 响应以及其他智能体的输出会绕过你的分类器,以及真正的工具感知型防御方案长什么样。
上下文长度是安全边界,而不仅仅是成本线
足够长的对话会将你的系统提示词埋在更新的 Token 之下,直到防护栏悄然失效。为什么上下文长度属于威胁模型——以及如何控制它。
Prompt Injection 是混淆代理问题,而非内容过滤问题
将 Prompt Injection 视为内容过滤问题是一场注定失败的军备竞赛。真正的漏洞在于“混淆代理”:即智能体利用借来的权限执行来自不可信渠道的指令。解决方案应当是限制其能力范围。
你的工具描述是模型遵循的指令通道
工具描述是模型视为权威指令的散文,但代码审查和输入清理从未检查过它们。本文将探讨被投毒的元数据和地毯式攻击是如何渗透进来的,以及弥合这一差距的规范。
对话历史是信任边界,而非文本块
对话历史是多源反馈流,而非仅可追加的状态。为每一轮对话的来源打上标签,使用 HMAC 锚定用户回合,并将工具输出封装在信任区内 —— 否则你的 Agent 攻击面将随对话轮数线性增长。
提示词注入漏洞赏金:当“损坏”没有明确定义时,如何划定程序范围
标准的赏金准则在面对以“提供帮助”为行为规范的 AI 功能时会失效。一个有效的程序需要基于 CIA 的严重性评估标准、概率性复现条款、明确的工具范围清单、安全港协议下的指定测试租户,以及一个受修复 SLA 约束的 AI 团队。
好帮手 AI 的悖论:为什么遵循指令是一个安全漏洞
让大语言模型(LLM)变得好用的“顺从性”,同时也让它们变得易受攻击。本文将探讨提示词注入攻击背后的工程现实、真实世界的漏洞案例,以及哪些防御措施能真正降低风险。
Prompt Injection 并不主要是一个攻击者问题
普通的用户内容 —— 产品评论、支持工单、文档 —— 可以在没有任何攻击者参与的情况下,大规模地覆盖你的 AI 行为。本文将探讨为什么标准防御手段会忽略这一结构性问题,以及真正解决该问题的架构模式。
Agent IAM 不等于 Service IAM:为什么当意图在运行时构建时 OAuth 会失效
OAuth 和 IAM 是为具有稳定意图的调用者设计的。Agent 的意图是在运行时根据提示词、检索到的文档和工具输出构建的 —— IAM 层永远看不到决定调用内容的大部分输入。
输出即有效载荷:你的 AI 威胁模型只守住了一半边界
AI 威胁模型通常止步于模型本身,并将输出视为安全内容。间接提示词注入将渲染的 Markdown、结构化输出、生成的代码以及工具调用参数转化为攻击载荷——而真正值得防御的边界其实位于模型的下游。