你无法删除的用户:AI 系统中的被遗忘权
一项“被遗忘权”请求揭示了 AI 系统中一个令人不安的事实:用户数据散布在模型权重、向量索引和缓存中,且没有单一的数据行可以删除。本文探讨如何为“可遗忘性”进行设计。
你的 Embedding 是个人身份信息 (PII):反向攻击与向量数据库中的被遗忘权
反向攻击可以从 embedding 中恢复出原始文本——甚至包括临床笔记中的姓名——这使得你的向量数据库属于个人数据,而非匿名的数学表示。本文将探讨为什么删除请求在面对软删除、快照和代理 ID 时会失效,以及如何通过删除传播架构来解决这一问题。
PII 脱敏哨兵如何悄然瓦解你的向量索引
将 PII 替换为哨兵令牌的隐私脱敏器可能会悄然主导你的嵌入几何结构,将每个脱敏后的文档坍缩到向量索引的单一枢纽中,并在基准测试无法监测到的地方降低检索质量。
那个保护了日志却让模型泄露输出结果的 PII 脱敏器
仅针对输入的 PII 脱敏器只是半个控制措施。一旦模型具备了生成能力,输出路径就变成了你在审查中从未提及的泄露面。
会话摘要抹掉了用户授予你的同意标志
压缩保留了智能体的回答,却遗忘了用户的选择。应将对话记忆视为语义和结构化两个流,否则你交付的将是隐私违规。
自身训练语料库成为泄露途径的 PII 脱敏器
一个基于真实 PII 训练的微调脱敏器,本质上是一个对其训练集中每条受保护记录都拥有读取权限的模型,并部署在任何人都可以查询的 API 之后 —— 而这一事实很少出现在隐私审查中。
你的产品视图从未呈现的推理 Token
扩展思维在每次调用中都会生成一个推理产物,你的工程师可以看到,但你的支持、PM 和事故处理团队却看不到。这个断层正是客户投诉集中的地方。
你的智能体无法穿透推理的脱敏层
隐私脱敏可以保留分类准确率,却悄悄破坏多步骤智能体所依赖的实体连续性。修复的关键不在于占位符是否存在,而在于它们的作用域如何划定。
内部评估集:一个无人审查的隐私边界
AI 团队通常根据生产环境的对话来评估模型,并将其称为内部数据集。根据目的限制原则,这其实是一个未经审查的独立数据处理环节。
少样本示例造成的租户泄露:当你的提示词库变成跨客户数据存储库
从生产追踪中挖掘少样本示例,会悄无声息地将你的系统提示词变成一个未经审计的多租户数据存储库。本文将介绍这种泄露是如何发生的,为什么它属于违反合同,以及在客户发现之前捕捉此类问题的规范流程。
当被遗忘权遇上微调:当删除止于快照
一旦客户数据进入损失函数,删除就不再是简单的行操作,而变成了系统重构。本文探讨血缘链、四种政策选择,以及现在已成为阻碍交付关键问题的采购条款。
在不触发法律红线的前提下,用生产数据训练你的 AI
用于 AI 模型改进的行为遥测数据如何与 GDPR 和 CCPA 产生冲突——以及联邦学习、差分隐私和同意架构等模式如何在不触发法律风险的前提下维持反馈闭环。