你无法删除的用户:AI 系统中的被遗忘权
一项“被遗忘权”请求揭示了 AI 系统中一个令人不安的事实:用户数据散布在模型权重、向量索引和缓存中,且没有单一的数据行可以删除。本文探讨如何为“可遗忘性”进行设计。
你的 Embedding 是个人身份信息 (PII):反向攻击与向量数据库中的被遗忘权
反向攻击可以从 embedding 中恢复出原始文本——甚至包括临床笔记中的姓名——这使得你的向量数据库属于个人数据,而非匿名的数学表示。本文将探讨为什么删除请求在面对软删除、快照和代理 ID 时会失效,以及如何通过删除传播架构来解决这一问题。
你的 Token 夜宿何方:LLM API 调用的数据驻留
在欧盟地区托管 LLM 推理并不等同于让你的提示词脱离外国司法管辖。这是一份关于数据驻留、CLOUD 法案以及故障关闭型网关架构的实践指南。
那个因无人负责而逃过租户删除清理的智能体记忆库
当所遍历的资产列表已过时,即使删除流程正确也无济于事。为什么每当发布一个无人申报的新持久化存储时,你的租户删除保证就在悄然失效。
服务商在 API 边界遵守但在缓存处违反的数据驻留契约
区域 API 终端节点承诺了你的请求去向,但未承诺满足该请求的缓存前缀字节存放地。可审计边界与缓存部署边界受不同的 SLA 约束 —— 而这一差距正是合规态势失效之处。
那个保护了日志却让模型泄露输出结果的 PII 脱敏器
仅针对输入的 PII 脱敏器只是半个控制措施。一旦模型具备了生成能力,输出路径就变成了你在审查中从未提及的泄露面。
那个脱敏了用户提问却遗漏了提示词缓存的 PII 脱敏器
保护分析流水线的脱敏器对推理路径上的提示词缓存毫无作用 —— 而这些未列入清单的缓存正是下一次数据留存违规的隐患所在。
检索流水线的数据驻留:那些跨境而去的 Embedding,以及并未跨境的 LLM 调用
你的推理端点固定在法兰克福,但你的 Embedding API、向量控制平面、重排序(Rerank)服务、Prompt 缓存和追踪存储却并非如此。本文将深入探讨 RAG 请求中的六个数据驻留层面,以及每个环节在不知不觉间跨境传输时所存在的组织架构差距。
智能体记忆是合规层面:你从未打算构建的记录管理系统
在智能体产品中,长期记忆并非仅仅是一项功能 —— 它是一个记录管理系统。从写入第一条数据的那天起,溯源、删除、审计和数据驻留义务便随之而来;在截止日期前临时修补这些功能的成本远高于在设计之初就构建它们。
评估数据集是附带正确答案的客户数据
黄金评估集是与标记的正确答案配对的真实客户查询 —— 但大多数团队将其视为工程辅助工具,绕过了为底层生产数据构建的每一项隐私控制。
当被遗忘权遇上微调:当删除止于快照
一旦客户数据进入损失函数,删除就不再是简单的行操作,而变成了系统重构。本文探讨血缘链、四种政策选择,以及现在已成为阻碍交付关键问题的采购条款。
在不触发法律红线的前提下,用生产数据训练你的 AI
用于 AI 模型改进的行为遥测数据如何与 GDPR 和 CCPA 产生冲突——以及联邦学习、差分隐私和同意架构等模式如何在不触发法律风险的前提下维持反馈闭环。