·tian
爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱
Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。
insider
agent-security
llm-agents
ai-engineering
+2·tian
工具组合沙箱逃逸:当三个安全工具组合成数据泄露时
每个工具的 ACL 都没有问题,但它们的组合导致了 PII 泄露。智能体权限表面是工具目录在组合下的闭包,而针对单个工具的审查只是在审计词汇,规划器却在构建句子。
agent-security
llm-security
tool-use
mcp
+1·tian
Prompt 表面积问题:为什么增加一个工具绝不仅仅是增加一个工具
为 LLM Agent 增加的每一个新工具都会呈非线性地增加行为复杂度 —— 产生交互效应、评估盲点和安全漏洞,其增长速度远快于能力增益。本文将探讨如何在 Agent 的表面积超出你的控制范围之前对其进行审计。
llm-agents
agent-security
ai-engineering
evaluation
·tian
智能体爆炸半径:在生产事故发生前界定最坏情况的影响范围
一个在生产环境中误触发的 AI 智能体,不只是失败——它会在权限范围内真实行动。本文介绍大多数团队跳过的上线前演练:对每个工具的最坏情况建模、按可逆性分类操作,并在第一次事故教会你边界在哪里之前,强制执行权限上限。
insider
llm-agents
ai-safety
ai-engineering
+2·tian
智能体内存投毒:跨会话持久存在的攻击手段
内存投毒允许攻击者在智能体的长期内存中植入指令,这些指令能跨会话存在并在数周后执行——在测试系统中注入成功率高达 95%。本文将介绍如何通过内存分区、来源追踪、时间衰减和行为漂移检测来进行防御。
agent-security
memory-poisoning
llm-safety
multi-agent
·tian
智能体沙箱与安全代码执行:根据风险匹配隔离深度
一份关于智能体沙箱光谱的实用指南——从 Docker 容器到 Firecracker microVM——涵盖了能力限制模型、真实世界的逃逸向量,以及根据风险匹配隔离深度的决策框架。
agent-security
sandboxing
code-execution
llm-agents