跳转到主要内容

10 含有标签「data-governance」

Posts tagged "data-governance" on TianPan.co.

查看所有标签

·tian

那个保护了日志却让模型泄露输出结果的 PII 脱敏器

仅针对输入的 PII 脱敏器只是半个控制措施。一旦模型具备了生成能力,输出路径就变成了你在审查中从未提及的泄露面。

privacy
llm
agents
security
+2
·tian

评估数据集是附带正确答案的客户数据

黄金评估集是与标记的正确答案配对的真实客户查询 —— 但大多数团队将其视为工程辅助工具,绕过了为底层生产数据构建的每一项隐私控制。

insider
llm-eval
ai-privacy
gdpr
+2
·tian

在不触发法律红线的前提下,用生产数据训练你的 AI

用于 AI 模型改进的行为遥测数据如何与 GDPR 和 CCPA 产生冲突——以及联邦学习、差分隐私和同意架构等模式如何在不触发法律风险的前提下维持反馈闭环。

insider
gdpr
privacy
ai-engineering
+2
·tian

数据敏感级别模型路由:管控哪个模型能看到哪些数据

大多数 AI 路由决策以成本和延迟为优化目标。但数据的隐私分类同样应当驱动路由——忽视这一点会埋下静默的合规违规,只有在审计时才会浮出水面。

ai-engineering
compliance
llm
privacy
+1
·tian

增加模态是一次隐私分类事件,而非简单的功能开关

沿用为文本编写的同意流程来发布视觉输入功能,会悄无声息地成倍扩大你的 PII 暴露面 —— EXIF 元数据、相邻内容泄露以及合同范围漂移,每一项都需要独立的分类、保留策略和审计。

ai-privacy
multimodal
vision-models
compliance
+1
·tian

你的 AI 聊天记录即证据:法律保存指令下的 LLM 产品保留设计

聊天日志属于 ESI。你需要设计四层保留机制,在真正需要之前建立法律保存注册表,并在数据摄入时标记出处 —— 否则你将在电子取证过程中为补全这些架构付出惨重代价。

insider
ai-infrastructure
compliance
data-governance
+1
·tian

生产环境中的隐私保护推理:云端API与本地部署之间的光谱

LLM隐私不是云端API与本地部署之间的二选一。了解四层控制光谱——PII脱敏、敏感性路由、差分隐私和可信执行环境——以及每种方式的真实工程成本和风险降低效果。

privacy
security
llm
production
+1
·tian

企业 RAG 治理:检索管道背后的组织架构

40–60% 的企业 RAG 部署无法进入生产环境。罪魁祸首几乎从来不是检索算法本身——而是治理问题:没有文档所有权、查询时未执行访问控制、PII 未加保护、新鲜度缺乏强制机制。

insider
rag
data-governance
enterprise-ai
+2
·tian

源头受污:RAG 语料库衰减与向量存储的数据治理

生产 RAG 系统会随着语料库积累过期数据块、相互矛盾的事实以及恶意注入内容而悄然退化。本文介绍如何将检索层作为基础设施来管理——通过 TTL 设计、摄取时冲突检测以及访问控制模式,保持系统的可信度。

rag
vector-databases
data-governance
production-ai
+1
·tian

微调数据集溯源:六个月后你无法回答的审计问题

大多数生产中的微调模型无法可靠回答训练样本的来源问题。这里提供溯源注册表模式和审计工作流,让你在监管机构询问之前就有答案。

insider
fine-tuning
data-governance
compliance
+1