← 返回全部文章

AI 训练数据脱敏怎么做?文档进入模型前的 6 步流程

面向国内 AI 和数据团队,说明合同、报告、扫描件进入预训练、微调或 RAG 前,如何核对来源与授权,处理直接标识符、准标识符和商业秘密,并完成复核、输出测试与版本回滚。

AI 训练数据脱敏怎么做?文档进入模型前的 6 步流程封面

核心要点

  • 训练数据脱敏必须先核对来源、授权和用途,再处理直接标识符、准标识符与商业秘密。
  • 脱敏卫士可在本机处理文档与扫描材料,通过规则、AI/NER 和人工复核准备训练或 RAG 副本。
  • 跨文档一致代指有助于保留实体关系,但映射表和还原信息必须与数据集分开控制。
  • 预训练、微调和 RAG 的撤回路径不同,不能只删除一个目录就视为全部清除。

把一批合同、客服工单、报告和扫描件整理成 AI 语料,团队最先检查的通常是格式:文件能不能读取,文字层是否完整,标签是否统一。

但“能被模型读取”和“适合交给模型”,是两件事。

这些文档里可能同时出现姓名、联系方式、身份证号、单位名称、合同编号、金额、客户关系和内部项目代号。如果团队只是删除文件名、打乱顺序,或者在页面上盖几个黑框,敏感内容仍可能留在正文、图片区域、OCR 文字层或多份文件的组合关系中。

这并不意味着模型一定会原样复现训练数据。不过,Carlini 等人在 USENIX Security 2021 的训练数据提取研究中,证明了特定模型和攻击条件下可以抽取个别训练样本。NIST 的 生成式 AI 风险管理框架配套文件也把敏感信息泄露、未授权使用和去匿名化列为数据隐私风险。它们说明的是技术可能性和风险管理思路,不代表任何模型都会泄露全部语料,也不是判断中国项目是否合法、合规的依据。

对企业而言,更稳妥的做法,是在数据进入模型前建立一套可复核、可追踪、可撤回的准备流程。本文会分别讨论预训练或从头训练、微调,以及 RAG/企业知识库,因为三者的“数据去了哪里”和“发现问题后怎么撤回”并不相同。

脱敏卫士在数据进入训练、微调或 RAG 之前承担文档准备工作台的角色。 团队可以在本机导入合同、报告、客服材料和扫描件,用规则与 AI/NER 生成敏感信息候选,人工修正误报和漏报,并用稳定代指保留获准的实体关系。这样交给后续数据工程链路的是经过用途筛选的副本,而不是未经区分的原始文件集合。

先判断数据能否使用,再讨论怎么脱敏

脱敏是技术处理,不会替团队补上缺失的数据来源、授权或使用目的。公司内部“已经保存”的合同、简历、病历、工单,也不等于可以自动改作模型训练材料。

在中国语境下,至少需要把几类问题分开核对:

  • 《个人信息保护法》将个人信息界定为与已识别或者可识别自然人有关的信息,并要求处理目的明确、合理,与目的直接相关,采取对个人权益影响最小的方式;医疗健康、金融账户、行踪轨迹等还可能属于敏感个人信息。姓名删掉后仍能凭单位、职位、日期和事件识别到个人的材料,不能只按“已经没有姓名”判断。
  • 《数据安全法》所称数据处理包括收集、存储、使用、加工、传输、提供和公开,并要求建立数据分类分级保护思路。训练语料的复制、标注和提供给外部服务,本身都属于需要纳入管理的数据处理活动。
  • 报价底表、配方、算法、源代码、客户交易习惯和未公开经营计划可能不属于个人信息,却可能涉及商业秘密。现行《反不正当竞争法》《商业秘密保护规定》都要求关注授权范围和保密措施,不能因为个人字段已经替换,就忽略这些内容。
  • 面向境内公众提供生成式 AI 服务时,《生成式人工智能服务管理暂行办法》对预训练、优化训练数据的合法来源、知识产权、个人信息和数据质量提出要求;该办法第二条同时明确了适用范围,未向境内公众提供服务的内部研发并非当然适用。项目究竟适用哪些法律、行业规则和合同约定,应由组织结合业务形态判断,不能靠一篇操作指南给出“一律可以使用”的结论。

因此,数据团队在接收文件时,需要的是来源和用途审查记录,而不是一句“已经脱敏”。法务、安全、业务和模型团队也不应把责任全部推给处理工具。

预训练、微调和 RAG:三种数据流不能混为一谈

“进入 AI”不是一个统一动作。不同数据流决定了敏感信息会停留在哪里、由谁控制,以及发生撤回或更正时能做什么。

数据流 数据如何参与系统 主要责任人 发现来源不当或个人提出撤回、更正时 验收重点
预训练/从头训练 大规模语料经过清洗、切分和迭代训练,影响模型参数 数据负责人确认来源与范围;训练负责人维护数据、代码、模型版本;安全与法务设定准入和处置规则 先冻结受影响的数据版本和模型发布;定位样本、派生分片与检查点,评估是否需要删除数据后重新训练或回退模型。仅删除源文件不能证明参数影响已经消失 数据谱系、重复样本、跨集合泄漏、已知敏感片段抽取测试和模型版本关联
微调/继续训练 较小的任务样本改变基础模型行为,可能形成独立权重或适配器 业务方定义目的;数据负责人控制样本;模型负责人管理基础模型、适配器和评测集 停用受影响的微调版本,删除不应使用的样本,回退到上一已验收版本或重新微调;同时清理派生缓存和评测副本 指令—回答对是否泄露原文、样本是否串入验证集、回滚点是否真实可用
RAG/企业知识库 原文或切片保存在文档库、对象存储、向量索引和缓存中,查询时再检索给模型 知识库负责人管理文档和权限;检索负责人管理切片、索引与缓存;应用负责人控制提示词和输出 从源库撤回文档,重建或删除对应切片和向量,清理缓存及失效副本,再验证旧内容无法被检索。通常不必重新训练基础模型,但要核实是否另有日志或反馈数据回流训练 文档权限是否传递到检索层、删除是否覆盖全部索引、引用是否指向正确版本、越权查询是否被阻断

这张表也解释了为什么 RAG 不能被一句“它不训练模型,所以不需要脱敏”带过。RAG 可能把命中的原文直接放进提示上下文;如果知识库权限、切片或缓存处理不当,敏感信息仍可能出现在回答中。反过来,预训练或微调一旦完成,也不能把“从文件夹删除原文”等同于完成模型侧撤回。

团队最好在立项时就写明谁能宣布停用数据、谁能冻结模型、谁能重建索引、谁负责答复个人信息相关请求,以及完成处置后由谁复验。没有这些角色,版本号只是标签,不是回滚能力。

训练数据中的敏感信息,为什么不只是姓名和手机号?

很多团队第一次整理训练语料时,会先搜索姓名、手机号和身份证号。这是必要的一步,却不是完整清单。

直接标识符、准标识符和业务秘密要分层识别

直接标识符包括姓名、身份证号、手机号、邮箱、银行卡号、详细地址、证件照片等,它们能直接指向个人。准标识符通常不能单独确认身份,但“城市 + 部门 + 职位 + 日期”“罕见病种 + 就诊机构 + 年龄”“案件类型 + 开庭日期 + 承办团队”等组合,可能把对象重新识别出来。

训练集还可能包含与个人无关但同样不宜进入模型的内容,例如:

  • 客户、供应商和合作方的未公开名单、交易习惯及联系人关系;
  • 合同编号、案件编号、内部账号、项目代码和系统地址;
  • 报价、成本、返利规则、预算、预测和尚未公开的经营计划;
  • 源代码、算法说明、产品缺陷、研发失败记录和技术路线;
  • 签名、印章、手写批注,以及图片、附件和页眉页脚中的识别标记。

风险也可能来自多份文件之间的关联。单独看一份材料时,“某部门负责人”“华东某城市”“某日签署”似乎不足以确认身份;当训练集中还有组织架构、会议纪要和合同附件时,这些线索可能重新拼出具体对象。NIST SP 800-188 关于去标识化技术与治理的研究,也特别区分直接标识符、准标识符和重识别风险,并把合成数据列为可评估的方法之一。这里同样只借鉴技术分类,不把 NIST 文件当作中国合规标准。

多份文档中的零散线索可能重新关联到同一对象

单份材料里的弱线索,在批量语料中可能形成新的关联。

因此,训练数据脱敏的目标不应只是“找到几个固定字段”,而是按使用目的识别直接标识、组合线索和机密业务内容,再判断哪些内容必须删除、代指、变换或保留。

训练语料是不是删得越多越安全?

不是。训练语料的价值通常来自上下文。如果把所有姓名、机构、地址和金额直接清空,句子关系可能断裂,模型也可能失去需要学习的结构。

例如:

张某代表甲公司与乙公司签署合同,随后由李某负责验收。

如果只把敏感内容全部清空,人物、机构和动作之间的关系会变得难以理解。更适合后续 AI 处理的方式,可能是:

<人物1> 代表 <单位1><单位2> 签署合同,随后由 <人物2> 负责验收。

稳定代指的关键不是随机换一个名字,而是在明确的数据集范围内,让同一实体使用同一代号、不同实体不发生碰撞。代指范围也不宜无限扩展:如果多个无关项目共用同一套全局映射,映射表本身会成为新的关联中心。更稳妥的做法是按项目或批准用途划分命名空间,把映射与训练副本分开保存,限制查看、还原和导出权限,并记录映射版本。向外提供训练副本时,不要把映射表一起打包。

相同匿名代指应用到多份关联文档

一致代指隐藏原始身份,同时保留跨文档的上下文关系。

金额也不能一概涂黑。如果模型需要学习“报价—成本—毛利”关系,可以按审批后的规则进行区间化、统一加减或统一乘除;统一加减通常保留差额,统一乘除通常保留比例。处理后要复核币种、单位、小数、负数、税额与合计,并避免把变换参数和结果数据放在同一个训练包里。如果真实数值对任务没有必要,直接删除或使用类别标签往往更合适。

无论使用删除、代指还是数值变换,都不能因此宣称数据已经匿名化或无法重识别。脱敏降低的是已识别风险,剩余风险仍取决于数据规模、可获得的外部信息和使用环境。

一个国内合成训练集示例:先处理种子,再生成和验收

假设一家国内制造企业要为售后故障分类模型准备训练集。原始工单包含客户姓名、手机号、设备序列号、所在园区、服务工程师、故障描述、配件报价和未公开的质量问题。业务只希望模型学习“现象—原因—处理建议”的关系,并不需要真实客户或真实金额。

团队可以先在受控副本中替换直接标识符和内部编号,对地区、日期、设备型号等准标识符做泛化,对金额按区间或统一规则变换,再由业务专家从处理后的模式中编写或生成合成样本。合成样本继续接受两类检查:一类是与原始工单做长文本和稀有片段相似度检查,避免“合成”只是复述原文;另一类是检查故障分布、类别边界和专业术语,避免为了隐私把数据做得脱离真实业务。

这是方法示例,不是某家客户的实际案例,也不代表合成数据天然安全。生成器如果先接触未处理原文,或者合成样本保留罕见设备、精确日期和唯一事件组合,仍可能泄露来源信息。合成数据也不能替代来源授权和目的审查。

在放行数据前,可以用下面的矩阵把判断留在同一张表里:

来源 授权或处理依据核对 目的 关键字段 处理方式 复核责任 验收条件
企业自有售后工单 核对原收集告知、合同和内部批准是否覆盖当前用途;不足时暂停进入语料 故障分类微调 姓名、电话、序列号、园区、工程师、报价、缺陷描述 直接标识符替换;准标识符泛化;金额区间化;机密缺陷分级排除 业务负责人 + 个人信息保护/法务复核人 抽样无可识别客户;任务标签和故障语义仍可用;审批记录完整
供应商维修报告 核对合同约定、保密义务、使用期限和再委托限制 补充技术术语 联系人、供应商名称、图纸编号、配方或工艺参数 未获许可的商业秘密整段排除;其余按批准范围代指 采购/法务 + 技术负责人 不含超授权内容;术语准确;接收范围与合同一致
扫描服务单和现场照片 核对照片、签名和定位信息的处理范围 OCR 与多模态分类 手写姓名、签名、印章、车牌、定位水印、EXIF 等隐藏信息 OCR 文字与像素区域分别检查;必要时裁剪或排除图片;元数据另行清理 图像复核人 + 数据负责人 导出图像与 OCR 文本双重反查;原图不进入训练目录
经批准的公开手册 核对版权、许可范围、版本和是否真的公开;“网上可见”不等于任意训练授权 补充设备知识 作者、版权说明、未公开附件、旧版本错误 保留必要出处;排除无授权附件;按版本入库 知识产权/内容负责人 来源可追溯;许可条件被满足;仅使用批准版本
基于已处理模式形成的合成样本 记录种子数据版本、生成方法和审核人 扩充少数故障类别 稀有事件组合、近似原句、虚构但不合理的编号和金额 长片段去重;稀有组合泛化;人工校正;不保存可逆映射 数据负责人 + 业务专家 与原文无异常长片段重合;分布和标签通过业务验收;可回溯生成版本

矩阵不是法律意见模板。“授权或处理依据”必须由组织结合数据来源、合同关系、业务角色和适用规则确认;脱敏人员只负责按已批准范围执行和记录。

文档进入模型前,怎样完成六步脱敏?

第一步:盘点来源、用途和责任人

为每批语料记录来源系统、取得时间、数据提供方、批准用途、拟进入的数据流、可访问角色和保留期限。把原始数据集设为只读受控版本,后续识别、替换和测试都在工作副本上进行,避免清洗时覆盖唯一原件。

同时建立停用联系人:出现来源异议、授权到期、内容更正或泄露事件时,谁能冻结数据版本,谁通知训练、检索和应用团队。若这个问题没有答案,先不要开始批量处理。

第二步:先分组去重,再建立字段清单

对代表性样本做格式和内容盘点,识别同一合同的扫描版、Word 版、附件版和转发版。近似重复文件、同一客户的关联材料或同一事件的多份记录,应在原始受控区先建立文档族标识;否则同一内容可能同时进入训练集和测试集,造成评测虚高,也可能让一条应撤回的记录留下多个副本。

固定格式字段,如身份证号、手机号、邮箱、合同编号和部分账号,适合用正则规则识别;姓名、地址、机构等依赖上下文的实体,需要语义识别辅助。组织内部的项目代号、客户简称和特殊编号,要用自定义规则或黑名单补充。必须保留但经常被误判的术语,可进入白名单。准标识符和商业秘密则需由业务人员参与判断,不能只靠格式匹配。

第三步:按下游任务选择删除、代指或变换

训练和微调通常需要保留句子结构,可优先评估稳定代指;公开展示或只供人阅读时,涂黑或星号可能更直观;金额、日期和地理位置则按任务需要选择删除、分桶、泛化或数值变换。

规则要在批量处理前用小样本验证。验证内容不只是“还剩几个敏感词”,还要检查实体关系、标签、段落顺序和数值逻辑是否保留。不要处理完整个数据集后,才发现模型需要的结构已经丢失。

第四步:把 OCR 文字层和图像像素当作两套输入复核

扫描 PDF、TIFF、JPG 和 PNG 可能没有可搜索文字,也可能同时存在 OCR 文字层与原始图像。只搜索 OCR 结果,会漏掉识别失败的手写姓名、模糊证件号、签名、印章、车牌和屏幕截图;只遮盖图像,又可能让隐藏文字层继续被复制或解析。

因此要分别检查 OCR 输出和可见像素,对低清晰度、倾斜、表格错列及手写区域建立人工队列。处理后在最终导出文件上重新 OCR,并用另一种阅读或解析方式反查。附件、批注、文件名和元数据也要按实际格式单独处理,不能假设正文工具会自动清理全部隐藏内容。

复核人员发现扫描文档中自动识别遗漏的敏感区域

自动识别缩小检查范围,最终导出前仍需要人工处理误报和漏报。

第五步:生成训练副本,并按文档族完成划分

从最终导出的副本上搜索已知姓名、邮箱、手机号、项目词和稀有片段,确认可见遮盖下没有可复制原文。随后按第二步建立的文档族、事件或实体分组划分训练集、验证集和测试集,使同一合同的不同版本、同一工单的附件或近似副本不会跨集合泄漏。

划分后再次做精确去重和近似去重,记录每个集合的文件清单、哈希、规则版本和生成时间。不要用“文件名不同”证明样本不同,也不要为了提高测试分数保留跨集合重复内容。

第六步:做模型输出测试,并把回滚做成真实动作

数据文件验收通过后,还要对实际模型或 RAG 应用做输出测试。可以使用经过批准的测试标记、合成姓名和稀有短语作为哨兵,测试正常问法、续写、角色诱导、跨文档汇总和越权检索;在受控环境中对输出做精确匹配与人工复核。测试结果只能证明所覆盖的模型版本、提示和数据范围内没有发现特定问题,不能证明模型永不记忆或泄露数据。

每次交付至少绑定四个版本:原始数据清单、脱敏规则与映射版本、训练/索引数据版本、模型或知识库版本。回滚演练要实际验证上一版本能启动、受影响版本能停用、RAG 旧切片无法再命中,以及临时目录、缓存和失败样本得到处置。只有文档记录、没有可执行路径,不算完成回滚。

原始材料留在内部,脱敏副本进入后续模型

本地完成文档脱敏只是一个准备边界,下游训练、模型服务和知识库仍需分别管理。

脱敏卫士在这条流程里承担什么角色?

脱敏卫士(RedactOS)在本文场景中的角色,是桌面端文档准备与人工复核工具,不是训练 API、RAG 网关、数据治理平台,也不负责证明模型训练合法合规。

桌面端可在本机粘贴文本,或导入 DOCX、TXT、文字型 PDF、扫描型 PDF 和图片。识别阶段可以组合预制正则、AI 语义识别、自定义规则和黑白名单:固定格式字段由规则处理,姓名、地址和机构等上下文实体由 AI 辅助识别;复核人员再取消误报、补标遗漏,并选择涂黑、星号、混淆代指或适用的金额变换方式。

处理关联材料时,同一实体可以在多份文件中沿用一致代指,批量结果可统一导出为面向 AI 处理的 Markdown。所有任务会形成记录;需要恢复内容时,可从已完成任务进入还原流程。任务记录、映射和还原信息本身仍是敏感资产,应限制访问并与交付副本分开管理。

脱敏卫士不会替组织核对数据来源与授权,不会自动完成数据集划分和模型输出测试,也不会在训练后从模型参数中删除样本。桌面端本地处理同样不代表后续训练平台、模型服务或知识库都在本地;脱敏副本发送到哪里、是否记录日志、保留多久,需要按下游系统另行核实。

交付前检查清单

  • [ ] 已记录来源、授权或处理依据、用途、访问角色和保留期限;
  • [ ] 已明确语料进入预训练、微调还是 RAG,并指定撤回、更新和停用责任人;
  • [ ] 已覆盖直接标识符、准标识符、商业秘密和组织特有字段;
  • [ ] 已为关联文档建立文档族,并处理精确重复和近似重复;
  • [ ] 已根据任务选择删除、稳定代指、泛化、区间化或数值变换;
  • [ ] 映射信息与训练副本分开保存,查看、还原和导出权限已受控;
  • [ ] 已检查扫描页、图片像素、OCR 文字层、附件及其他隐藏内容;
  • [ ] 已由业务人员和复核人员处理误报、漏报及语义破坏;
  • [ ] 训练、验证和测试集合按文档族划分,集合之间已再次去重;
  • [ ] 已在最终数据与实际模型输出上完成反查和针对性测试;
  • [ ] 数据、规则、映射、模型或索引版本可以关联,且回滚路径经过演练;
  • [ ] 已核实下游平台的权限、日志、缓存、留存和删除机制。

常见问题

1. 把姓名和手机号替换后,数据就能直接用于训练吗?

不能据此直接判断。还要检查准标识符、商业秘密、图片和跨文档关联,并确认来源、授权或其他处理依据、用途和保存期限。代指属于降低风险的技术措施,不会自动把数据变成匿名信息,也不等于取得训练授权。

2. RAG 不改变基础模型参数,还需要先脱敏吗?

需要按风险决定。RAG 可能把命中的原文切片直接送进模型上下文;权限失配、索引残留或缓存都可能让原文出现在回答中。高敏材料可先形成面向检索的脱敏副本,同时仍要在知识库层实施文档权限、索引删除和越权测试。

3. 个人撤回同意或来源文件需要删除时,删掉训练目录够吗?

通常不够。应先确认项目适用的处理依据和具体请求,再沿数据谱系定位派生分片、微调权重、检查点、评测副本、索引、缓存和日志。RAG 通常可以通过撤回文档并重建索引处置;已经参与训练或微调的数据,则需要模型负责人评估停用、回退或重新训练,不能承诺简单删除文件就消除参数影响。

4. 使用合成数据就不会泄露原始信息吗?

不是。合成器可能复述种子样本,稀有属性组合也可能指向真实对象。应先处理种子数据,再对合成结果做长片段重合、罕见组合、可识别性和业务真实性检查,并保留生成版本与审核记录。

5. 金额必须全部删除吗?

取决于任务。如果真实金额没有必要,应删除或使用类别标签;如果模型需要学习差额、比例或区间,可在批准范围内使用统一加减、乘除、分桶或泛化,并复核合计、币种、小数和异常值。变换规则及参数不应与训练副本无控制地放在一起。

先用一小批有代表性的文件跑通来源审查、脱敏、人工复核、集合划分、模型测试和撤回演练,再决定是否扩大数据规模。文档处理只是 AI 数据治理的一部分,但它决定了原始敏感内容是否会在一开始就进入更难撤回的模型和索引链路。

下一步: 数据团队可先查看脱敏卫士的多格式识别、一致代指和人工复核能力,再用合成或已获授权的非敏感样本在线体验。真实训练语料应按组织批准的数据环境和桌面端流程处理。

相关阅读

参考来源

  1. | 《中华人民共和国个人信息保护法》 | < | 个人信息、可识别性、目的明确与最小影响、敏感个人信息、个人权利和处理者责任 | 不将“脱敏”直接写成匿名化,不就具体项目给出合法性结论 |
  2. | 《中华人民共和国数据安全法》 | < | 数据处理活动范围、分类分级和贯穿处理链路的安全责任 | 不把一般性要求改写为产品认证或合规保证 |
  3. | 《生成式人工智能服务管理暂行办法》 | < | 预训练、优化训练数据的合法来源、知识产权、个人信息和数据质量要求 | 正文同时说明第二条适用范围;未向境内公众提供服务的内部研发并非当然适用 |
  4. | 《中华人民共和国反不正当竞争法》(2025 年修订) | < | 训练材料中的商业秘密不能被个人信息字段清单替代 | 不把所有内部资料概括为商业秘密,是否构成需结合非公知性、商业价值和保密措施判断 |
  5. | 《商业秘密保护规定》 | < | 技术/经营信息示例、授权边界和保密措施;该规定自 2026-06-01 施行 | 仅用于当前中国语境的字段和治理提示,不替代法务审核 |
  6. | Nicholas Carlini 等,《Extracting Training Data from Large Language Models》,USENIX Security 2021 | < | 特定模型和攻击条件下,个别训练样本可能被抽取;可据此说明模型记忆与提取具有技术可能性 | “任何模型都会泄露全部语料”“脱敏能阻止所有模型记忆” |
  7. | NIST AI 600-1,《Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile》 | < | 生成式 AI 生命周期中存在敏感信息泄露、未授权使用和去匿名化风险;上线前测试属于风险管理活动 | 中国法律要求、认证结论或某项目已经合规 |
  8. | NIST SP 800-188,《De-Identifying Government Datasets: Techniques and Governance》 | < | 区分直接标识符、准标识符与重识别风险;合成数据是一种需要评估和治理的处理方法 | “简单遮盖已充分去标识化”或“合成数据天然安全” |