跳转到主要内容

12 含有标签「llm-security」

Posts tagged "llm-security" on TianPan.co.

查看所有标签

·tian

那个将你的系统提示词泄露到客户审计日志中的调试日志器

你的平台团队为了排查故障而添加的一个字段,最终出现在了租户的审计导出中 —— 这次泄露不需要任何攻击者,仅仅是两个“正确”的决定组合在了一起。

llm-security
observability
audit-logs
prompt-leakage
+1
·tian

绕过清理器的提示词注入:当智能体通过工具读取恶意指令

输入清理器位于用户和模型之间,但使用工具的智能体还有数十种其他的摄入路径。本文将探讨为什么检索到的文档、网页抓取、MCP 响应以及其他智能体的输出会绕过你的分类器,以及真正的工具感知型防御方案长什么样。

llm-security
prompt-injection
ai-agents
mcp
+1
·tian

当你的禁止列表变成秘籍:提示词中负面示例的隐性成本

成熟的生产环境提示词往往会积累一长串“不要做”的列表,但这在无形中适得其反——既暴露了攻击面,又增加了原本想要禁止的内容的产出率。

prompt-engineering
llm-security
evals
ai-architecture
·tian

提示词注入漏洞赏金:当“损坏”没有明确定义时,如何划定程序范围

标准的赏金准则在面对以“提供帮助”为行为规范的 AI 功能时会失效。一个有效的程序需要基于 CIA 的严重性评估标准、概率性复现条款、明确的工具范围清单、安全港协议下的指定测试租户,以及一个受修复 SLA 约束的 AI 团队。

security
ai-agents
bug-bounty
prompt-injection
+1
·tian

工具组合沙箱逃逸:当三个安全工具组合成数据泄露时

每个工具的 ACL 都没有问题,但它们的组合导致了 PII 泄露。智能体权限表面是工具目录在组合下的闭包,而针对单个工具的审查只是在审计词汇,规划器却在构建句子。

agent-security
llm-security
tool-use
mcp
+1
·tian

绕过词汇表:当用户学会用礼貌的英语进行越狱

生产环境中的 AI 产品容易被“假设”、“用于教育目的”、“为了写故事”这类三词构架绕过拒绝策略。了解如何检测和防御你的用户从社交平台学到的绕过词汇。

ai-safety
llm-security
jailbreak
refusal-policy
+1
·tian

你的微调大模型正在泄露哪些训练数据

微调模型可能通过逐字提取、成员推理和属性推理攻击暴露训练数据——仅需200美元就能演示。本文是关于威胁模型、差分隐私权衡、输出净化和生产部署主动审计方法的技术指南。

insider
llm-security
fine-tuning
privacy
+2
·tian

输出即有效载荷:你的 AI 威胁模型只守住了一半边界

AI 威胁模型通常止步于模型本身,并将输出视为安全内容。间接提示词注入将渲染的 Markdown、结构化输出、生成的代码以及工具调用参数转化为攻击载荷——而真正值得防御的边界其实位于模型的下游。

ai-security
threat-modeling
llm-security
appsec
+1
·tian

你的系统提示词终会泄露:针对提示词提取进行设计

提示词提取是对 LLM 产品的一种隐蔽攻击。应将系统提示词视为公开内容,将秘密移出上下文,并为其构建评估体系。

insider
llm-security
prompt-engineering
owasp
+1
·tian

AI 可观测性泄露:你的追踪堆栈正成为数据外泄的出口

托管式追踪 SDK 正在悄无声息地将完整的 prompt 和回复传送到你的信任边界之外。这是一份面向 LLM 团队的合规指南:对字段进行分类、在数据流出前进行清洗,并将 SDK 审计作为一项基本策略。

ai-observability
data-privacy
llm-security
compliance
+1
·tian

免费层级滥用经济学:当你的 AI 慷慨被机器人拖垮

为 SaaS 设计的免费层级策略正在悄悄让 AI 产品破产。本文将揭示机器人如何利用你的慷慨牟利,以及如何通过速率限制、工作量证明和指纹识别模式来止血。

insider
ai-economics
free-tier
bot-abuse
+1
·tian

生产环境中的提示注入:真正有效的攻击模式及如何阻止它们

提示注入是头号 LLM 漏洞——而大多数团队的防御措施在适应性攻击者面前都失败了。本文将提供一份实用指南,揭示导致真实 CVE 的攻击模式,以及能够真正降低风险的架构控制措施。

llm-security
prompt-injection
ai-engineering
agentic-systems