文档脱敏怎么做:从接收到销毁的完整流程指南
围绕接收、分类、工作副本、识别、处置、复核、导出、交付、保留与销毁,讲清 DOCX、TXT、文字 PDF、扫描 PDF、图片及转换格式的文档脱敏流程。
合同准备发给外部顾问时,操作员把姓名和手机号遮住了,却把带修订记录的原始 DOCX 一起放进压缩包;扫描案卷在每页正文上都看不到身份证号,附件目录里却还保留了当事人全名;财务人员把 Excel 转成 PDF 后完成涂黑,接收方核算时才发现跨页表格少了一列,金额对应关系已经错位。
这三类问题说明,文档脱敏从来不只是“在页面上处理几处文字”。它管理的是一份材料从进入任务、形成副本、识别敏感内容、人工作出决定,到输出、交付、保留和退出的完整过程。页面打码只是其中一个动作。原件是否混入、转换是否失真、成品能否搜索出原值、映射是否被一同发送,都会决定最终结果是否合格。
如果只需要理解删除、遮盖、替换、一致代指和摘要化对语义的影响,可以先看文本脱敏基础指南;如果要建立数据库、日志、接口和文档在内的治理地图,可参考数据脱敏完整指南。本文只解决一个更具体的问题:一份文档要共享、公开、归档或交给下游工具之前,怎样走完一条可执行、可复核、可交付的脱敏流程。
先定义文档脱敏:处理的是交付物,不是几个关键词
文档脱敏,是根据一次明确的使用目的和接收范围,在授权工作副本中识别并处置不应披露的文档内容,经过人工复核和成品验收后生成可交付版本,同时分别管理原件、任务记录、恢复信息和临时文件。
这一定义有五个边界。
第一,任务对象是具体文档。 它可以是 DOCX、TXT、文字型 PDF、扫描型 PDF 或图片。文档不只有正文,还可能有页眉页脚、表格、图片、批注、修订、文件名和其他容器内容。内容工具能处理什么,必须与源格式的完整检查分开说明。
第二,处理依据是本次用途。 一份合同用于审查条款时,主体类型、权利义务和时间线可能必须保留;用于公开培训时,联系人、账号、未公开报价和可反推项目身份的细节可能都不需要。不存在一张脱离用途、对所有文件永久适用的字段清单。
第三,操作对象是工作副本。 原件是否作为档案保存、何时删除,不应由操作员临时决定。正确做法是保留受控原件,复制出有任务编号的工作副本,只在副本上转换、识别和修改。
第四,合格对象是最终交付文件。 编辑界面里看见黑块、星号或代号,不等于接收人拿到的文件已经安全。必须重新打开实际输出,检查搜索、复制、页面、文件名、附件清单和业务可用性。
第五,脱敏不等于匿名化。 如果组织仍保留原件、映射或任务内恢复路径,结果可能在受控条件下还原。它可以降低非授权接收人的可见范围,却不能被自动宣称为不可逆匿名数据。
工具应该在哪一段发挥作用
一条文档流程最费力的地方,往往不是点一次导出,而是把分散的候选找出来、让熟悉业务的人逐项判断,并确保结果没有在格式切换中走样。人工只靠关键词搜索容易漏掉姓名变体、机构简称、图片区域和组织特有编号;只靠自动识别又会把正常词语误判,或错过上下文中的例外。
脱敏卫士(RedactOS)在本篇只承担一个角色:文档内容工作副本的本机候选识别、人工复核与输出回看工作台。 桌面端可在本机、断网环境处理 DOCX、TXT、文字型 PDF、扫描型 PDF 和常见图片;固定格式字段主要由正则形成候选,姓名、地址、单位或机构等语义内容可由 AI/NER 形成候选。操作员再取消误报、划词补上遗漏,图片区域可手动框选,完成后导出并形成任务记录。
把能力放回具体失败点,产品价值才不只是“懂方法”。
| 常见失败 | 脱敏卫士承担的动作 | 可观察结果 |
|---|---|---|
| 真实高敏文件被上传到边界不清的网页服务 | 桌面端在本机导入、识别、复核和导出,可断网使用 | 文档、处理过程、任务记录和还原关联留在本机;后续交给其他工具的数据流仍需另查 |
| 操作员只搜身份证号和手机号,漏掉姓名、地址、机构、案号或合同号 | 正则与 AI/NER 按固定格式和上下文分别形成候选 | 多类内容进入同一个可见复核范围,不再完全依赖记忆逐页查找 |
| 自动候选存在误报、漏报,或组织有内部项目号 | 可取消误报、划词补标,并用自定义规则及黑白名单处理重复例外 | 当次结果能人工校正,高频问题可转成后续可复用口径;仍不承诺自动零遗漏 |
| 扫描页和图片中的敏感区域无法被普通文本搜索覆盖 | 支持扫描型 PDF、图片输入及图片区域手动框选 | 非文字层内容也进入复核,不会因为“搜不到”就被当作不存在 |
| 处理结果与恢复关系散落在临时文件里 | 任务自动形成记录,可查看脱敏列表或映射信息,并从已完成任务进入受控还原 | 内部回看有任务入口;映射、记录和还原权限仍须作为敏感资产管理 |
这五项映射同时覆盖了数据边界、输入与识别、人工复核、输出与留痕。它们形成的转化链是:先明确谁能看到什么,再在本机工作副本生成候选,由业务人员作最终判断,导出后回看真实成品,必要时从受控任务恢复。工具降低查找、重复编辑和规则维护成本,但不替法务、档案、安全或业务负责人决定材料能否对外。
国内版一年 199 元、永久版 399 元,整体成本低于竞品。比较总成本时仍应把席位数、订阅或买断、续费、部署方式和实际任务量放在同一口径,不能拿不同授权模型的一个数字直接相减。对主要处理合同、案卷、报告和扫描材料的个人或小团队,本机工作流与透明授权能避免为不需要的数据库治理能力承担额外复杂度。
第一步:接收——没有任务卡,先不要碰文件
文件刚到手时,最容易发生的错误是立即打开并开始涂改。接收阶段应该先建立一张任务卡,至少回答以下问题。
| 接收项 | 必须写清楚 | 不能接受的模糊说法 |
|---|---|---|
| 使用目的 | 接收人拿到结果后要审条款、做分类、公开阅读还是交给 AI 分析 | “后续使用” |
| 接收对象 | 具体角色、团队、外部机构或系统 | “内部”“合作方” |
| 禁止披露 | 姓名、联系方式、地址、账号、案件信息、报价、商业秘密等 | “敏感信息” |
| 允许保留 | 为完成任务必须保留的主体类型、时间、金额关系、条款结构 | “尽量保留” |
| 输入清单 | 文件数、格式、页数、附件、压缩包和来源 | “一批材料” |
| 输出要求 | DOCX、PDF、TXT、图片或其他约定格式,是否需要可检索 | “处理好发我” |
| 恢复需要 | 是否允许还原、由谁执行、映射是否可导出 | “以后再说” |
| 保留期限 | 原件、工作副本、输出、映射和任务记录分别如何处置 | “做完留着” |
接收人还应核对文件指纹式信息:文件名、大小、页数、压缩包层级和附件数量。这里不一定要使用复杂系统,任务编号加一张清单就能避免“原来有 17 个文件,最后只交了 16 个”的低级错误。若材料来自邮件、聊天或移动存储,先复制到授权目录,不要在多个入口留下无法追踪的临时副本。
第二步:分类——先按风险和格式分流
分类不是给文件贴一个“机密”标签就结束。至少要建立两条轴:一条是内容风险,一条是技术格式。
内容风险决定谁审批、复核强度和交付范围。例如,公开宣传稿可能只含少量联系人;劳动人事材料可能同时包含身份、家庭、薪酬和评价;合同附件可能包含账户、印章、报价和供应链关系;证据或档案材料的删改还可能影响完整性判断。高风险材料应明确处理人与复核人是否分离,最终披露边界交给组织相应专业角色确认。
技术格式决定材料如何进入工作区。不要被扩展名迷惑:同样是 PDF,可能有可搜索文字层,也可能只是页面图像;一个 DOCX 可能主要由表格和嵌入图片构成;一张截图可能把姓名写在界面标题栏和文件名中。分类阶段可抽取一页尝试搜索、复制,并检查图片、表格、页眉页脚和批注等结构是否存在。
第三步:建立工作副本——原件、过程和结果要分家
建议把每个任务至少分成三个区域:原件_只读、工作副本和待交付。原件目录只允许经授权角色访问,不在其中直接保存修改;工作副本可以转换、重命名和处理;待交付区只放通过验收的最终结果及必要清单,不放原件、映射或中间导出。
文件命名要让状态一眼可辨,例如“任务编号_材料序号_工作副本”和“任务编号_材料序号_脱敏交付”。不要使用“最终”“最终2”“真的最终”这类无法追踪的名称。发生返工时,记录返工原因和替换的交付版本,避免接收人继续使用旧副本。
这一步还有一个常被忽略的动作:确定谁能接触工作副本。文件放在本机,不代表所有本机账户、同步目录、备份软件或协作工具都自动安全。桌面端本地处理能明确脱敏动作的数据边界,但终端权限、磁盘保护、同步策略和临时目录仍由组织管理。
第四步:按格式选择入口,不支持格式先转换再回源
不同格式不能套用同一个“上传—识别—导出”口令。下面这张表可作为入口分流表。
| 输入类型 | 推荐工作副本入口 | 主要风险 | 成品验收重点 |
|---|---|---|---|
| TXT | 直接导入文本副本 | 编码、换行、制表符或分隔符改变 | 用指定编码重开,检查行数、字段边界和下游读取 |
| DOCX | 导入受控 DOCX 副本;涉及修订、批注和隐藏文字时,接续Word 与 WPS 文字脱敏流程检查源结构 | 表格、页眉页脚、文本框、批注、修订、嵌入对象 | 在文字处理应用重开,检查正文之外结构及版式 |
| 文字型 PDF | 导入可搜索 PDF 副本;从标记、应用处理到成品反查可接续PDF 完整脱敏指南 | 视觉遮挡不等于底层文字已处理,页面还有其他容器内容 | 搜索、复制、选取、页面浏览,并按源文件检查附加结构 |
| 扫描型 PDF | 作为扫描件导入并检查识别质量;低置信页、框选和第二工具反查可接续扫描 PDF 脱敏流程 | 倾斜、低清、手写、印章、复杂表格导致识别遗漏 | 逐页视觉复核,关注边缘、印章、页眉和低质量页 |
| 常见图片 | 导入图片副本,候选加手动框选 | 截图边角、界面标题、二维码、手写批注和背景文字 | 按原分辨率查看,确认裁剪边缘与所有框选区域 |
| Excel、CSV、PPTX 等未确认原生支持格式 | 从来源应用生成受控 DOCX、PDF、TXT 或图片工作副本;PPTX 的备注、母版、隐藏页和嵌入对象另按PowerPoint 与 WPS 演示脱敏流程清理 | 公式、隐藏区域、批注、对象、动画、字段关系和布局可能丢失 | 处理后回到来源应用或业务流程,核对结构、关系与用途 |
最后一行尤其重要。不能因为某个格式能“另存为 PDF”,就宣称工具原生支持该格式。Excel 转 PDF 可能只输出当前打印区域,隐藏工作表、公式和筛选状态不会自然进入结果;CSV 转 TXT 可能因分隔符或编码改变而错列;PPTX 转 PDF 可能丢失演讲者备注、动画层和嵌入文件。转换只是为文档内容建立一个可处理工作副本,不会自动清理原生文件里的所有信息。
因此,每次转换应记录来源应用、转换方式、页数或记录数变化,以及已知不保留的结构。处理完成后,再由熟悉来源格式的人按业务用途验收。若接收方必须继续编辑原生表格、演示文稿、设计文件或带电子签名的材料,单纯转换后的脱敏副本可能不适合,应该改用原生应用的专业流程。
第五步:识别——建立候选,不要把候选当结论
识别前先把任务卡中的“禁止披露”翻译成字段清单。常见字段包括姓名、地址、单位或机构、身份证号、手机号、邮箱、电话、银行卡号、统一社会信用代码、合同编号、司法案号、金额、日期、网址和 IP;具体文件还可能有内部项目号、客户代码、产品代号、门店名称或可反推身份的组合信息。
固定结构字段适合先用正则候选,例如手机号、邮箱、身份证号和合同编号;姓名、地址、机构等依赖上下文的内容适合用语义识别形成候选;组织特有编号则要通过自定义规则、黑名单或明确的人工检查补充。字段清单不要求每次全选。为了公开合同条款,签约主体是否保留与联系人是否隐藏,可以是两项不同决定。
候选数量既不是成绩,也不是合格证明。命中一千项可能包含大量误报,命中十项也可能漏掉关键姓名。识别阶段的目标是把人工不可控的“从头翻找”缩小为一个有重点的复核范围,并标出机器不擅长的区域。
第六步:处置——选择与用途匹配的结果形态
文档内容进入候选清单后,处理者要决定删除、涂黑、星号、代指或保留。对公开展示的页面副本,涂黑可以明确显示有内容被隐去;对需要阅读关系的合同、访谈或案情摘要,一致代指能保留“同一个人”“不同单位”等关联;只需保护联系方式时,星号可能更容易保留字段外观。
处置决策不宜只按字段类型。金额在公开采购案例中可能需要全部隐藏,在财务分析材料里则可能需要保留差额或比例;单位名称可能是条款理解所需主体,也可能是尚未公开的交易对象。每个例外都应回到用途和接收人,而不是由操作员猜测。
对图片和扫描页,除了文字候选,还要检查人脸、签名、印章、二维码、条形码、界面头像、地图位置和背景白板等区域。内容工具的手动框选可以补充明显的图像区域,但二维码是否包含敏感载荷、印章是否允许处理、签名是否涉及证据或档案要求,应由相应负责人确认。
第七步:人工复核——用两轮检查代替漫无目的地重看
第一轮叫字段复核,沿候选清单逐项判断误报和漏报。复核者检查同一实体的别名、简称、全称是否一致,编号是否被断行或空格拆开,页眉页脚是否重复出现,图片框选是否完整。高频误报可加入白名单,高频漏报可形成自定义规则或黑名单,但规则变更要记录适用范围,不要为一个例外破坏所有后续材料。
第二轮叫场景复核,不再盯候选,而是站在接收人角度从头阅读。问题包括:通过职位、精确日期、罕见项目与地点组合,能否反推出当事人?代号是否串人?删掉一句话后是否改变责任或时间线?表格中列名仍在,但对应值是否错位?这种复核能发现“单个字段都处理了,组合起来仍暴露”的问题。
金融、合同、招聘、证据和档案材料尤其不应由操作员独自确定最终披露范围。工具和本文提供一般工作流,具体材料的法律效力、档案保留、财务完整性、人事披露和证据要求,应交由组织法务、档案、内审、安全、HR 或业务负责人确认。
第八步:导出——冻结候选成品,再验收实际文件
导出时先生成“候选成品”,不要直接把软件界面的结果发送出去。记录导出格式、文件名、时间、页数或字数,并把它放进待验收区。此后所有检查都针对这个实际文件;如果重新 OCR、转换、压缩、合并、盖章或保存,就产生了新的候选成品,需要重新验收。
验收至少分为保护与可用两条轨道。
保护轨道检查不应披露的内容是否仍可见、可搜、可复制、可选择,文件名和目录是否泄露身份,压缩包是否混入原件、映射或临时文件。对于 PDF,还应根据来源与风险使用适合的工具检查批注、附件、表单、图层、脚本、嵌入对象或其他容器内容。脱敏卫士负责内容工作副本,不应被宣传为通用 PDF 结构清理器。
可用轨道检查页数、段落、表格、编号、时间线、主体关系和接收人的核心任务能否完成。公开阅读副本应保证页面不缺失;交给顾问审条款的 DOCX 应保证条款层级可辨;交给 AI 总结的代指文本应保证同一实体标记稳定。保护通过但业务无法使用,同样不能交付。
第九步:交付——只交需要的结果,不交整个工作现场
交付包通常只需要三类内容:通过验收的脱敏成品、简洁的文件清单,以及必要的使用边界说明。若接收方需要知道哪些字段被处理,可以说明类型和规则,不必随包附上原值映射。
发送前做一次“站在收件人电脑前”的检查:下载交付包到一个干净目录,解压后查看实际文件名和数量,逐个打开,确认没有快捷方式失效、绝对路径暴露或旧版本混入。通过邮件或协作平台发送时,权限、有效期、转发范围与下载记录由实际系统配置决定,不要因为文件已经脱敏就放弃访问控制。
映射表和任务内还原信息不能与脱敏结果无控制地一同流转。若确需由内部角色恢复,应通过受控任务执行,并把谁可以查看任务、谁能还原、谁能导出映射写入组织规则。外部接收者通常只需要结果,不需要恢复钥匙。
第十步:保留与销毁——让任务有一个真正的结束状态
交付成功并不代表任务结束。项目至少还有原件、工作副本、候选成品、正式输出、任务记录、映射信息和可能存在的转换临时文件。每类资产的敏感程度与保留理由不同,不能用“全部保留”或“一键全删”替代判断。
建议在任务卡中设置退出清单:原件按档案制度归档或处置;工作副本在复核和异议期结束后按约定清理;失败导出与临时转换文件及时删除;正式输出按业务期限保留;任务记录、还原关联和映射按更严格权限管理;接收方到期后的删除责任在交付协议中说明。
删除动作也需要边界。产品历史任务可用于回看、还原或删除,但具体保存周期、删除任务是否同步影响结果和关联信息、终端备份如何处理,必须按实际版本与组织部署确认。不要在没有核实的情况下把界面上的“删除”理解为所有副本、备份和外部交付物均已消失。
一个合成场景:把 24 份项目材料交给外部顾问
假设一家企业要让外部顾问分析项目延期原因。材料包括 10 份 DOCX 会议纪要、8 份文字型 PDF 合同与函件、4 份扫描 PDF 签收单和 2 张沟通截图。顾问需要时间线、角色关系、合同节点和延期原因,不需要真实姓名、联系方式、详细地址、银行账号、签名图像与未公开客户名称。
接收时,项目负责人列出 24 个文件、用途、顾问角色、禁止字段和可保留内容;档案人员确认原件留存,不允许直接修改。操作员在授权目录建立工作副本,按格式分组,先检查 PDF 是否可搜索,再把扫描件和截图作为图像类材料处理。
识别阶段,固定号码与合同编号由规则候选,姓名、机构和地址由语义候选;客户代号及内部里程碑编号加入任务特例。处置时,人物和单位使用一致代指,以保留“谁在何时向谁反馈”的关系;联系方式与账户涂黑;签名区域人工框选。操作员完成字段复核后,由项目经理做场景复核,重点检查简称、职位和罕见日期组合是否仍可反推客户。
导出后,团队重新打开实际成品,搜索原姓名和号码,复制 PDF 页面文字,逐页查看扫描件边缘,并核对合同节点与会议时间线仍然完整。交付包只包含 24 份结果和一张文件清单,不包含原件、映射与失败导出。顾问确认收到后,工作副本按约定进入保留期;恢复权限仍留在内部受控任务中。
这个场景的价值不在于证明某个按钮多快,而在于每一步都有负责人、有输入、有输出、有失败处理。即使换一种文档工具,任务卡、格式分流、双轨验收和退出清单仍然成立。
哪些情况适合使用脱敏卫士,哪些情况不适合
适合的任务通常有四个特征:材料是 DOCX、TXT、文字型 PDF、扫描型 PDF 或常见图片;内容中既有固定格式字段,也有姓名、地址、机构等语义实体;真实文件不宜上传公网,或需要断网处理;团队愿意安排人工复核,并希望保留任务记录和受控还原关系。合同外发、案卷共享、尽调报告、招聘材料、审计文件、培训案例和 AI 分析前工作副本都可能落在这一范围。
不适合把它当作答案的情况也要写清楚:需要直接在生产数据库执行动态掩码;要求原生修改 Excel、CSV、PPTX、CAD 或专业设计格式且必须完整保留其内部结构;需要通用清理 PDF 的全部元数据、附件、脚本、表单和电子签名结构;希望不经人工复核就获得合规结论;或要求替代组织的权限、档案、加密、备份和外发审批系统。这些任务需要相应数据库平台、来源应用、PDF 专业工具或组织治理流程配合。
真实 PDF、扫描件或其他高敏材料,应优先评估本机桌面流程,可查看脱敏卫士的文档处理能力。如果只是 TXT、DOCX 或合成的非敏感文本样例,可以先用在线体验了解候选识别、代指和复核方式;不要把真实敏感文件当作体验材料。
常见问题
1. 文档脱敏和数据脱敏有什么区别?
数据脱敏是更大的治理概念,可以涉及数据库、日志、接口、测试副本、文档和图片。文档脱敏聚焦具体文件及其生命周期,除了正文内容,还要处理格式入口、工作副本、页面与图像、导出成品、交付包和保留退出。脱敏卫士在其中承担文档内容工作副本节点,不替代数据库治理平台。
2. DOCX 转成 PDF 再涂黑,是否一定安全?
不一定。转换可能遗漏修订、批注、隐藏内容或嵌入对象,PDF 上的黑块也可能只是视觉覆盖。应先明确转换保留了什么,再对最终 PDF 做搜索、复制、选取与视觉检查,并按风险检查容器内容。若接收方必须继续使用 DOCX,还要在来源应用中验收最终交付版本。
3. 扫描 PDF 没有文字层,为什么仍可能漏脱?
扫描页可能倾斜、模糊、带印章、手写字或复杂表格,自动识别会受图像质量影响。处理时既要利用识别候选,也要逐页视觉检查,并对未被识别的图片区域手动框选。搜索不到文字只能说明没有可搜索文字层,不能证明页面没有敏感内容。
4. Excel、CSV 或 PPTX 可以直接交给脱敏卫士吗?
当前明确的桌面端支持范围是 DOCX、TXT、文字型 PDF、扫描型 PDF 和常见图片,不能声称原生处理 Excel、CSV 或 PPTX。可以从来源应用生成受控的支持格式工作副本,但转换可能丢失公式、隐藏区域、批注、关系、动画、对象或布局,处理后必须回到来源应用或业务流程验收。
5. 自动识别完成后,为什么还需要人工复核?
规则擅长固定格式,语义识别擅长结合上下文形成姓名、地址和机构等候选,但文件质量、专业领域、简称、别名和组织特例会带来误报与漏报。人工复核负责取消错误候选、补上遗漏,并判断哪些内容为本次用途必须保留。自动识别缩小检查范围,不替人承担披露决定。
6. 脱敏结果可以还原,是否说明脱敏没有意义?
不是。文档可以对普通接收者隐藏原值,同时在组织内部通过受控任务保留恢复能力,适合外发结果与内部审批并存的场景。关键是把原件、映射、任务记录和还原权限作为敏感资产管理,不与结果一同无控制发送。若业务要求真正不可逆匿名化,还需要更严格的风险评估和验证,不能只看页面效果。
结语:文档脱敏的终点不是“打完码”
成熟的文档脱敏流程,不以黑块数量或机器命中数衡量,而以三个结果收尾:接收人看不到不该看到的内容,仍能完成被授权的任务;组织知道原件、工作副本、输出和恢复信息分别在哪里;任务到期后,每类资产都有明确的保留或销毁状态。
把接收、分类、工作副本、识别、处置、复核、导出、交付、保留与销毁连起来,脱敏才从一次编辑动作变成可重复的文档工作流。工具在其中最有价值的位置,是把候选发现、人工判断和结果回看组织起来;真正的安全边界,最终由用途、角色、格式和验收共同决定。
文中项目材料场景为说明流程而构造,不对应真实客户、案件或项目;涉及具体法律、档案、财务、人事或证据判断时,请以组织专业负责人意见为准。
常见问题
1. 文档脱敏和数据脱敏有什么区别?
数据脱敏是更大的治理概念,可以涉及数据库、日志、接口、测试副本、文档和图片。文档脱敏聚焦具体文件及其生命周期,除了正文内容,还要处理格式入口、工作副本、页面与图像、导出成品、交付包和保留退出。脱敏卫士在其中承担文档内容工作副本节点,不替代数据库治理平台。
2. DOCX 转成 PDF 再涂黑,是否一定安全?
不一定。转换可能遗漏修订、批注、隐藏内容或嵌入对象,PDF 上的黑块也可能只是视觉覆盖。应先明确转换保留了什么,再对最终 PDF 做搜索、复制、选取与视觉检查,并按风险检查容器内容。若接收方必须继续使用 DOCX,还要在来源应用中验收最终交付版本。
3. 扫描 PDF 没有文字层,为什么仍可能漏脱?
扫描页可能倾斜、模糊、带印章、手写字或复杂表格,自动识别会受图像质量影响。处理时既要利用识别候选,也要逐页视觉检查,并对未被识别的图片区域手动框选。搜索不到文字只能说明没有可搜索文字层,不能证明页面没有敏感内容。
4. Excel、CSV 或 PPTX 可以直接交给脱敏卫士吗?
当前明确的桌面端支持范围是 DOCX、TXT、文字型 PDF、扫描型 PDF 和常见图片,不能声称原生处理 Excel、CSV 或 PPTX。可以从来源应用生成受控的支持格式工作副本,但转换可能丢失公式、隐藏区域、批注、关系、动画、对象或布局,处理后必须回到来源应用或业务流程验收。
5. 自动识别完成后,为什么还需要人工复核?
规则擅长固定格式,语义识别擅长结合上下文形成姓名、地址和机构等候选,但文件质量、专业领域、简称、别名和组织特例会带来误报与漏报。人工复核负责取消错误候选、补上遗漏,并判断哪些内容为本次用途必须保留。自动识别缩小检查范围,不替人承担披露决定。
6. 脱敏结果可以还原,是否说明脱敏没有意义?
不是。文档可以对普通接收者隐藏原值,同时在组织内部通过受控任务保留恢复能力,适合外发结果与内部审批并存的场景。关键是把原件、映射、任务记录和还原权限作为敏感资产管理,不与结果一同无控制发送。若业务要求真正不可逆匿名化,还需要更严格的风险评估和验证,不能只看页面效果。