← 返回全部文章

业务材料交给 AI 前:自动脱敏后为什么还要人工复核

合同、财务底稿、尽调材料、咨询记录、客服记录或企业知识库交给 AI 前,自动识别只能缩小排查范围。还要人工修正漏脱与误脱、确认输出方式并验收实际副本,最终只提交复核后的安全版本。

双手修正合同上的错误遮挡与遗漏敏感栏

核心要点

  • 业务材料交给 AI 前,应先在本地形成经过人工复核的安全版本,未脱敏原始材料不直接提交给 AI 厂商。
  • 漏脱可能把身份线索带入 AI 输入,误脱则可能破坏合同主体、财务关系、访谈角色或客服事件的分析语境。
  • 复核应对照原文、处理结果和识别清单,修正本次问题,再把稳定重复的误脱与漏脱沉淀为黑白名单或规则。
  • AI 使用复核后的安全版本;需要保留对应关系时,映射字典应与交付文件分离并留在受控环境。
业务材料交给 AI 前:自动脱敏后为什么还要人工复核

合同要交给 AI 提取履约义务,财务底稿要做归类,尽调材料要整理风险点,咨询访谈和客服记录要归纳问题,企业知识库要接入检索。这些任务都要求模型读懂业务内容,却不要求模型看到材料里的真实姓名、联系方式、账号、地址或内部项目编号。

自动脱敏能先找出候选敏感项,但识别完成不代表文件已经适合提交。漏掉一个身份线索,未脱敏信息就可能进入 AI 输入;误删一个责任主体或项目代号,模型拿到的材料又可能失去分析所需的关系。

更准确的边界是:先在本地完成脱敏和人工复核,未脱敏原始材料不直接交给 AI 厂商;AI 使用的是复核后的安全版本;采用混淆代指且需要保留对应关系时,映射字典留在受控环境。这不等于业务数据完全不传给 AI 厂商,安全版本仍包含完成任务所需的业务内容。

复核人员在原稿、处理结果和导出副本之间完成最后核对

AI 能读取,不等于原始材料适合直接提交

业务材料不是整齐的字段表。一个名称是否需要隐藏,取决于它在当前材料中的角色,也取决于 AI 接下来要做什么。

同一个机构名,在公开政策分析中可能可以保留,在客户尽调材料中却可能直接指向交易参与方。内部项目简称没有固定号码结构,可能没有被预制规则命中;普通地名放进咨询记录后,也可能与人物身份拼成可识别线索。

自动识别适合快速缩小排查范围,最终取舍仍要由熟悉材料用途的人完成。复核时要同时处理两类问题:本应隐藏但没有命中的漏脱,以及本应保留却被替换的误脱。

漏脱影响信息边界,误脱影响材料可用性。前者可能把原始身份线索带进模型,后者可能让合同主体、资金关系、访谈对象或客服事件发生混淆。只追求遮得更多,并不能得到适合 AI 使用的版本。

如果还没有确定本批材料要检查哪些类别,可以先参考常见敏感信息清单,再根据具体任务确定必须隐藏、可以保留和需要维持关联的内容。

第一步:把原文、处理结果和识别清单放在一起看

只看脱敏结果,很难发现哪些内容根本没有被识别;只看原文,又不容易确认每一项最终被怎样替换。提交 AI 前,需要把原文上下文、处理结果和识别项目清单连成一条判断链。

脱敏卫士工作台会把原文内容、脱敏结果和脱敏列表放在同一处理界面。复核者可以先在原文中理解人物、机构和事件关系,再看替换后的版本是否保留任务所需语境,最后在清单中确认对应项目是否启用。

脱敏卫士工作台对照原文、占位替换结果和识别清单

先看原文语境,再核对 AI 将使用的替换结果,最后回到清单确认处理状态。

检查顺序应跟着材料风险走。合同和尽调文件要留意标题、签章、落款、交易编号及附件;财务材料要关注账户、往来单位和备注字段;咨询、客服记录常有昵称、口语化地址和散落在上下文中的联系方式;知识库文档还可能在页眉页脚、示例和历史批注里保留身份线索。

有些线索单独看并不敏感,组合后却能指向特定对象。也有一些词看起来像姓名或地址,实际是业务术语。复核者要做的是判断这份安全版本是否既守住信息边界,又足以支持当前 AI 任务。

复核人员并排核对原稿、处理结果和项目清单后再放入导出托盘

导出应发生在三层信息核对之后,而不是自动识别结束之后。

第二步:修正误脱,保住 AI 任务需要的语境

误脱不一定造成信息泄露,却会直接降低材料质量。合同中的两个主体被替换成同一个代号,模型可能无法区分权利义务;财务摘要失去科目或往来方类别,归类结果会缺少依据;访谈记录删掉角色信息,观点便无法对应到正确群体。

在脱敏卫士中,发现本次误脱时,可以在脱敏项目清单里关闭不需要处理的项目。关闭前仍要回到原文确认该内容是否在其他位置重复出现,避免修正一处时放过另一处真正需要处理的位置。

如果同一个词在同类材料中频繁被误脱,而且业务上确定必须保留,可以将它加入白名单,减少后续任务中的重复撤销。不过白名单不是免检词库。某个名称在一批公开资料中可以保留,不代表它出现在另一份客户材料时仍可直接进入 AI 输入。

本次修正完成后,应顺着相邻段落再读一遍,确认人物、机构、时间和事件关系仍然清楚。对摘要、抽取、分类和知识库检索来说,可用的安全版本需要保留结构,不是把所有实体一概抹去。

第三步:补上漏脱,再处理反复出现的遗漏

漏脱往往不在识别清单中,复核者需要回到原文主动寻找。标题、页眉页脚、落款、扫描页边角、手写批注和图片区域,都是容易被忽略的位置。简称、别名、内部项目号和只出现一次的业务编号,也值得单独检查。

对于文本漏项,脱敏卫士支持选中文字后指定敏感信息类型和替换代号,把遗漏补进当前结果。这个动作适合少量、偶发且依赖上下文判断的内容。

脱敏卫士对选中文字指定敏感类型和替换代号

自动识别未命中时,可选中具体文本并补充本次需要的处理项。

图片材料还需要视觉检查。产品支持手动框选自定义区域,复核时可据此处理印章、人脸、手写信息、二维码附近内容和扫描件边角,不能只靠文字搜索确认安全。

同一种遗漏如果在同类文件中反复出现,可以将组织特有编号、内部项目号或特殊字段沉淀为自定义规则,把必须处理的固定词加入黑名单。频繁误脱则可以在口径稳定时使用白名单。规则能减少下一批材料的重复劳动,但不会替代导出前的人工复核。

判断是否值得维护规则,可以看遗漏是否连续出现、判断口径是否稳定、模式能否清楚描述。高度依赖上下文的偶发内容,继续留给人工判断更稳妥。

第四步:按 AI 任务选择输出方式,单独控制映射信息

漏脱和误脱修正后,还要确认替换方式是否支持模型要完成的任务。脱敏卫士提供涂黑、星号遮盖和混淆代指等方式,各自保留的信息不同。

如果文件只供人查看,涂黑或星号更直观。需要让 AI 继续做摘要、要素抽取、关系分析或知识库检索时,混淆代指更容易保留句子结构和实体之间的区别。具体选择可以结合可逆与不可逆处理方式的差异判断。

这一步至少要回答几个与任务直接相关的问题:模型是否需要区分不同人物或机构,字段类型是否需要保留,关联材料是否使用一致代号,任务结束后是否存在还原需求,以及还原权限由谁掌握。

如果需要在内部还原结果,映射字典应与交给 AI 的安全版本分开,留在受控环境。提交给 AI 厂商的是复核后的安全版本,不应把原件、映射表或其他能够恢复真实身份的中间文件一并上传。

这里也要避免另一种含混说法:经过脱敏,不等于业务数据完全不传给 AI 厂商。合同条款、财务关系、访谈内容或客服问题仍可能存在于安全版本中,只是直接身份信息和已确定需要隔离的敏感项经过处理。是否允许把这些业务内容交给特定 AI 服务,还要服从组织自己的授权、供应商和数据管理要求。

第五步:验收 AI 实际会收到的副本

界面中的结果通过复核后,再执行保存导出。脱敏卫士会在任务完成后形成记录,结果区提供快捷编辑、保存导出、去还原以及脱敏列表或映射表等入口。

最后一次验收应针对实际导出的文件。打开准备上传给 AI 的副本,按模型实际会收到的内容检查:

  • 搜索一组已知姓名、手机号、邮箱、项目代号和业务编号;
  • 抽查标题、页眉页脚、落款及长文中重复出现的实体;
  • 检查图片、扫描页和不能直接搜索的区域;
  • 确认代指没有造成主体混淆、句子断裂或关键关系丢失;
  • 核对交付目录,只保留安全版本,不夹带原件、映射字典或中间文件。

如果材料要求在本机或断网环境中处理,应在开始前明确版本和数据边界,可参考离线本地文档脱敏的检查重点。本地处理解决原始材料在哪儿运行的问题,复核解决安全版本是否可用的问题;两者都不能代替对 AI 服务和后续保存方式的管理。

发现问题后,偶发项回到当前任务修正,重复项再进入规则或黑白名单。修正完成要重新导出,并再次检查实际副本,避免工作台里的版本已经改对,上传目录里仍留着旧文件。

交给 AI 的应是复核后的安全版本

一份业务材料从原件变成 AI 可用副本,要经过识别、对照、纠错、输出选择和导出验收。脱敏卫士把自动识别、人工修正、规则维护、导出与任务记录放进同一条处理流程,但不会替材料负责人决定哪些内容可以交给 AI,也不承诺一次自动处理百分之百正确。

可以先从一份范围可控、结构复杂的真实材料开始:明确 AI 任务,确定必须隐藏和必须保留的内容,在本地脱敏并完成复核,只把验收后的安全版本交给 AI,映射字典继续留在受控环境。跑通这条边界,才算把自动脱敏真正接进业务流程。

常见问题

业务材料自动脱敏后,可以直接交给 AI 吗?

不建议。自动识别给出的是候选项,还要对照原文、脱敏结果和识别清单处理漏脱与误脱,并验收实际导出的安全版本。

人工复核为什么既要查漏脱,也要查误脱?

漏脱可能暴露身份线索,误脱可能删掉 AI 分析所需的主体、关系和上下文。安全版本需要同时控制信息边界和材料可用性。

交给 AI 的安全版本还算业务数据吗?

仍可能包含完成摘要、抽取、检索或分析所需的业务内容,因此不能声称业务数据完全不传给 AI 厂商;未脱敏原件不直接提交,映射字典留在受控环境。

自动识别没有命中的内容怎样处理?

文本遗漏可选中后指定敏感类型和替换代号,图片遗漏可手动框选区域;稳定重复的遗漏再考虑沉淀为自定义规则或黑名单。

参考来源

  1. 脱敏卫士敏感信息识别指南
  2. 脱敏卫士可逆与不可逆脱敏指南
  3. 脱敏卫士离线本地处理指南