你的 AI 团队所谓的“评估集”(eval set),在大多数发布 LLM 功能的公司中,其实是从生产日志中提取的真实客户对话集合。团队中没有人认为这是一个隐私事件。数据从未离开过集群。没有配置新系统。没有增加供应商。一名工程师写了一个查询,将几千条追踪记录(traces)导出到标注工具中,然后团队就开始根据这些记录对模型输出进行评分。法律团队从未听说过这件事,因为从内部来看,什么都没有改变——原本就存在于同一个数据库中的对话,现在只是被几名工程师和一个裁判模型(judge model)读取了而已。
这就是那个无人审查的隐私边界。客户向你发送消息是为了让你回答他们。他们并不是为了让你拿这些消息去衡量模型才把消息给你的。这两种用途在存储层看起来完全一样,在推理层感觉也一样,但在每一种现代隐私监管制度下,它们属于不同的处理目的——而两者之间的鸿沟,正是下一轮合规阵痛将要降临的地方。
边界在工程端之所以不可见,是因为数据在物理上并没有移动。凌晨 2 点由聊天处理器写入对话表的一行数据,在上午 11 点被评估脚本读取。同一行。同一个数据库。同样的访问控制。唯一改变的是某人读取数据的原因 ,而“原因”并不是工程栈会跟踪的属性。目的限制(Purpose limitation)是一个法律概念,它存在于你的数据库 schema 中并不存在的一列里。
目的限制:工程部门从未内化的规则
为某一目的收集的个人数据不能在不告知的情况下转作他用的原则,在不同的监管体系下有不同的名称——GDPR 中的目的限制,大多数州隐私法中的“特定、明确且合法目的”条款,以及 FTC 关于 AI 公司履行隐私承诺的反复指导——但对工程的影响是一样的。你收集客户数据的合法依据是“提供客户要求的服务”。使用相同的数据来评估、调优、校准或基准测试 AI 系统则是一个独立的目的。它需要自己的合法依据,而该合法依据要么需要在客户看到的通知中披露,要么需要通过带有记录在案的平衡测试的合法利益来支持。
工程师很少遇到这条规则,因为数据工程工具没有将其体现出来。查询计划器不会警告你,将 conversations 与 eval_cases 进行关联(join)是一种目的变更。向量数据库(vector store)不知道“为 few-shot 提示词查找相似示例”和“为评估集查找相似示例”是对同一个嵌入(embedding)的不同用途。追踪查看器(trace viewer)将客户消息和标注过的评估示例视为同一种对象。基础设施抹平了法律视为关键支撑的这种区别。
结果就是法律团队最终会面临的这种局面:AI 团队花了六个月时间,针对一个“内部追踪记录”语料库来完善裁判模型,经检查发现,这些记录几乎完全由可识别的客户对话组成,其中一些包含支付详情、健康信息或客户在产品内部标记为私密的内容。这些客户都没有同意将他们的对话用作评估材料,因为根本没有人问过。
集群边界不等于隐私边界
当问题浮出水面时,AI 团队最常见的辩解通常是“但数据从未离开过集群”。这种论点误解了隐私监管的真正对象。隐私法监管的不是流出(egress);它监管的是处理 (processing)。以新目的读取数据就是处理。对 user_id 进行哈希并将该行复制到 evals 表就是处理。让裁判模型对回复进行评分就是处理。让工程师滚动查看 20 个示例以调试回归问题就是处理。这些操作都没有向 VPC 边界外发送任何数据包,这与法律问题无关。
这也是公司现有的 SOC 2 和 ISO 27001 控制措施给人带来虚假安全感的地方。这些控制措施是围绕原始目的的访问管理而设计的。它们回答了“读取这些数据的人是否正确?”这一问题。但它们没有回答“这个人读取这些数据是否是为了客户授权的目的?”这一问题。在现有的角色模型下,评估工程师几乎肯定拥有对数据库的合法访问权限。但这并不意味着这种用途是合法的。
数据集的内部性质往往还会绕过 DPIA(数据保护影响评估)流程。DPIA 应该在任何高风险个人数据处理开始之前进行,而使用可识别的客户对话来评估模型是一个教科书式的高风险处理案例——数据量大、可能涉及特殊类别、涉及下游自动化决策。但由于从内部来看并没有感到有什么新变化,因此没有触发 DPIA。隐私团队准入门户上的表格会问“你是否在增加新供应商?”,而答案是否。
触发事件总是来自客户的提问,而非审计
这种反模式的有趣之处在于它通常是如何暴露的。几乎从未有审计能发现它。审计关注的是供应商列表、数据流图和许可记录。而内部评估流水线在这三者中都是不可见的。触发事件几乎总是客户的提问——有时是 DSAR,有时是企业客户的采购团队询问其租户的对话是否被用于模型评估,有时是一个好奇的用户给支持部门发邮件,询问 AI 是否正在根据他们的消息进行训练。
那封邮件是无法回答的。或者更确切地说,它是可以回答的,但诚实地回答需要告诉客户:是的,他们的对话被导入了一个评估集,工程师团队和裁判模型已经根据这个评估集对产品进行了数月的评分;不,在他们注册时看到的通知中并没有披露这一点;是的,该评估集现在对几个已发布的行为起到了关键支撑作用;不,没有干净的方法来移除他们的特定贡献,因为评估案例已经发生了变化,而且裁判模型已经针对聚合数据进行了校准。
就在这一刻,公司意识到“内部”并不属于隐私类别。对话从支持工程师传到隐私团队,再到法律团队,最后传到 AI 团队,而 AI 团队被问到了一个他们无法给出清晰答案的问题:评估集中有哪些数据、它们是如何进入的、法律依据是什么,以及我们是否可以在不作废六个月衡量工作的情况下从中移除特定用户。诚实的回答通常是:溯源没有在行级进行追踪,法律依据从未确定,而且移除的成本高到足以让校准工作从头开始。该团队一直在没有数据治理规范的情况下运作,而如果六个月前有人问过法律团队,他们本会坚持要求这种规范。
规范到底是什么样的 修复这个问题并不深奥,但它并不光鲜,大多数团队都会抵制,因为这感觉像是给已经在发布的工作增加了额外开销。这种规范的形式如下:
预先声明独立的评估目的。 隐私声明和面向客户的数据处理条款需要将“服务质量评估,包括 AI 驱动功能的评估”列为特定目的,并需要从操作层面解释这意味着什么。大多数声明中已有的模糊条款“我们使用你的数据来改进服务”并不能涵盖这一点——监管机构已经明确表示,AI 训练和评估需要比通用的服务改进更具体的披露。
为该特定目的确定法律依据。 对于大多数 B2B 产品,这将是合法利益(legitimate interest),这意味着需要一份外部审查员能够理解的书面平衡测试。对于 B2C 和特殊类别的数据,这可能意味着需要获得许可,这意味着需要有加入(opt-in)流程和真正的退出(opt-out)机制,以便能真正将用户从未来的评估集中移除。
评估案例级别的溯源元数据。 评估集中的每一行都需要知道它来自哪里、何时导入、适用何种许可或法律依据,以及源客户随后是否撤回了许可或已被删除。这是 AI 团队认为成本最高的部分,因为这意味着评估集不再是一个静态的 CSV 文件——它是一个带有保留规则的真相源表(source-of-truth table)的实时视图。像 Langfuse 和 Weave 这样的工具已经开始提供相关的原语,而 W&B Weave 文档中关于追踪中 PII 脱敏的内容,是了解操作流程的一个不错的参考。
在导入时进行 PII 脱敏,而不是在显示时。 一种常见的偷懒做法是将原始文本留在评估库中,并在标注 UI 中依靠脱敏视图。这是错误的层级。脱敏需要发生在生产对话库和评估库之间的边界,这样工程师、裁判模型和下游工具就不会意外看到未脱敏的形式。分层检测——基于模式加基于模型,并配合一致的合成数据交换——是目前的实践现状。
覆盖评估集的 DSAR 和删除路径。 当客户询问“你们拥有我的哪些数据”时,评估集必须是隐私团队查询的系统之一。当客户要求删除时,评估集必须是履行该请求的系统之一。这是大多数团队尚未构建的部分,也是第一封邮件到来时会引发合规火灾的部分。
经得起审计的裁判校准日志。 对你的评估案例进行评分的裁判模型是针对特定的输入分布进行调优的。如果该分布包含没有法律依据的个人数据,那么校准本身就是非法处理操作的下游产物,而对该制度的严格解读认为,必须在干净的语料库上重新进行校准。大多数团队都不想听到这一点。他们会在第一次客户投诉让他们耗费三周时间后,在第二次听到时才会接受。
做好这件事的真实代价是评估速度税 团队之所以抵制这种规范,是因为它减慢了开发内环(inner loop)的速度。在今天,一名工程师发现了一个回归问题,从生产环境中抓取 40 个案例,将它们放入评估集,并在当天下午就发布修复程序。而在明天,当评估集变成一个拥有溯源、授权和保留策略的受管数据集时,同样的流程就会产生摩擦。这 40 个案例必须经过脱敏步骤、附上溯源元数据、对照授权记录进行检查,并最终存入版本控制的评估存储库中。其中一些会被拒绝。另一些在存入时会带有约束其用途的元数据。工程师的一个下午变成了整整一天。
这种“税收”是真实存在的,也是 AI 团队为了站在公司其他部门早已遵守的合规边界之内所必须付出的代价。数据科学团队在用途限制规则下已经运作了十年。产品分析团队在产品的整个生命周期中一直在编写数据处理协议。在大多数公司中,AI 团队是唯一一个将客户数据导入新的处理环境,却没有任何组织内其他部门习以为常的管控措施的数据消费团队。评估速度税就是追赶这些进度所付出的成本。
领先于此的团队并不是因为读了一篇博文才这样做。他们这样做是因为有人——也许是客户、监管机构、企业采购团队,或者是读到新闻的董事会成员——提出了问题,而团队从答案中发现,他们的集群内部并不像他们想象的那样是一个避风港。那些仍在以“但数据从未离开集群”为借口进行辩解的团队,正在一个他们看不见的时钟下计时。当时钟归零的那一刻,往往就是第一个心思缜密的客户填写联系表单的时候。
会员专享
余下内容仅对会员开放。 会员可读完整内容 —— 每一个公开发布的观点背后,那些框架、决策与推理的全貌。
— 完整文章,包含未公开存档的部分 — 可落地的工作框架,附带权衡与决策依据 — 新文章抢先看,先于公开发布 登录以继续阅读→ 随时取消 · 一次订阅,畅读全部