文档脱敏具体要脱去哪些敏感信息?
文档脱敏不能只检查身份证号。本文按身份标识、联系方式、账户支付、业务编号、商业信息和组合识别风险梳理敏感信息范围,并说明正文、表格、批注、页眉页脚与扫描图片的复核方法。
核心要点
- 文档脱敏范围应由共享对象和使用目的决定,而不能只按身份证号等固定字段清单处理。
- 需要检查身份标识、联系方式、账号支付、业务编号、商业信息以及多个普通字段组合后的识别风险。
- 正文、表格、页眉页脚、批注、修订痕迹和扫描图片都应纳入检查,并在导出前处理误报和漏报。
- RedactOS 可结合规则与 AI/NER 识别不同类型的信息,但最终可共享范围仍需由人工确认。
文档脱敏不是只遮住身份证号:先识别需要保护的信息范围
文档脱敏先看共享对象和用途:对外发送、跨部门流转、演示培训或测试使用的副本,保留信息的粒度并不相同。基础排查可优先关注以下内容:
全量启用已识别的敏感信息类别后,仍需逐项人工复核处理结果。
- 身份标识:姓名、身份证号、护照号、出生日期、照片等;
- 联系方式与地址线索:手机号、邮箱、住址、详细地点、收件信息等;
- 账号及支付信息:登录账号、银行卡号、支付账户、验证码、账户余额或交易记录等;
- 证照和业务编号:营业执照编号、证件编号、客户编号、合同编号、订单号、项目编号等;
- 业务与内部资料:报价、交易往来、审批记录、内部流程、客户关系及未公开项目内容。
单个字段看似普通,也可能在组合后暴露对象或事项。例如,职位、部门、时间、地点和项目名称同时出现,可能让接收者关联出具体员工、客户或业务关系。因此,不能只按固定字段名单处理,还要结合文档上下文、接收范围和保密要求复核。
使用脱敏卫士 RedactOS 前,可先将内容分为可保留、必须遮蔽和需人工判断三类,再按实际共享目的处理。对披露边界不明确的信息,保留业务授权与人工复核环节,避免把工具处理当作内容审查的替代。
按文档类型建立脱敏清单,避免漏掉隐藏在业务内容中的敏感信息
脱敏清单应随文档用途调整,而不能只搜索几类固定字段。合同可逐项核对签约主体、联系人、联系方式、账户信息、签名或盖章区域;简历可检查姓名、电话、邮箱、住址、证件信息及工作经历中的可识别线索;病历、财务材料和客户资料,则应由资料责任人先界定哪些内容允许在当前接收范围内保留。
按主体身份、联系方式和业务文书等类别选择需要识别的脱敏要素。
检查位置也要覆盖整份文件:正文段落之外,表格单元格、页眉页脚、批注、修订痕迹、附件页和扫描件中的手写内容,都应纳入同一份核对清单。对扫描页,不能仅依赖文本搜索,还要逐页查看图像区域。
对外发送时,清单应围绕接收方完成任务所必需的信息收缩;内部协作时,应按参与人员的职责确定可见内容;归档留存则应明确原始文件与共享版本的区分,避免后续误用。
使用脱敏卫士 RedactOS 前,可先把上述清单转化为待处理字段、文档范围和复核责任人;具体处理方式与适用边界,应以实际文件格式、共享目的和已确认的产品能力为准。
需要批量处理或保留可用文档时,如何用脱敏卫士 RedactOS承接脱敏任务
当材料需要对外发布、内部共享,或先处理后再交给 AI 分析时,脱敏卫士 RedactOS可将人工查找、复制替换和逐页检查整理为导入、识别、复核、导出、还原与留痕的任务流程。它面向法律、合规、政企及其他高敏材料处理场景,并非通用文档编辑器。
在脱敏列表中按类别核对识别位置,关闭误报并检查漏报。
用户可在信息脱敏任务中直接粘贴文本,或多选上传文件:单个文件进入单篇流程,多个文件进入批量流程。在线体验版支持 .docx;桌面端支持 .docx、.txt、文字型 PDF、扫描型 PDF 和图片。批量任务不设固定文件数量限制,实际处理规模取决于系统配置和可用资源。
开始处理前,可按本次外发用途选择需要识别的实体类型,不必启用所有项目。身份证号、手机号、邮箱、案号、合同编号和阿拉伯数字金额等固定格式字段可由正则规则处理;姓名、地址、单位、机构等依赖上下文的信息,可由 AI/NER 识别。可选处理范围还包括银行卡号、统一社会信用代码、金额、日期、网址、IP、账号及证照编号等。
完成识别后,结果区会显示脱敏文本、脱敏项目清单以及可读文本映射表等入口。用户可针对用途选择混淆代指、星号或涂黑等输出方式,并保存导出为 Word、文本、图片,或复制处理结果;已完成任务会形成记录,后续如确有需要,可在任务内恢复所需内容,无需另存还原文件。
自动识别的结果仍受文档质量、上下文、语言、国家地区规则和专业领域影响。正式导出前,用户应检查项目清单:取消误脱项、将必须保留的词加入白名单,或对遗漏内容划词补充;图片还可手动框选区域。脱敏卫士 RedactOS 提供的是自动识别加人工复核的工作方式,不能替代最终内容检查。
脱敏后仍要复核:如何确认可共享范围,并理解工具使用边界
文档完成处理,并不等于可以立即外发。复核时,处理者应回到实际共享目的,检查是否仍保留身份信息、联系方式、地址、案号、金额、账号或商业秘密等不应随该版本流转的内容;同时确认被处理的项目是否影响文意、证据关系或业务判断。
选择星号替换后,在同一工作台核对原文、处理结果与脱敏项目。
使用脱敏卫士 RedactOS 时,自动识别后的项目会形成可编辑清单。复核者可关闭误脱项目,或将必须保留的词加入白名单;发现遗漏时,可划词补充,图片材料还可手动框选区域。对反复出现的遗漏,可进一步沉淀为自定义规则或黑名单。 这一环节不能省略:识别效果会受到文档质量、上下文、语言、国家地区规则及专业领域的影响,产品采用自动识别加人工复核的方式,并不承诺零遗漏。
涉及公开发布、对外共享、交由第三方工具处理或进入 AI 分析的材料,业务负责人应确认共享范围;安全负责人则需结合实际工作流确认部署、数据流、模型调用与合规策略。 若任务需要保留可还原能力,还应明确谁可查看、还原或删除任务,以及历史记录保存、删除和操作日志等部署策略。任务自动记录与任务内还原属于 脱敏卫士 RedactOS 的能力,但具体权限、保存周期、加密和审计条件取决于实际部署管理。
准备外发时,可在复核完成后按用途导出所需结果;若后续要让 Agent 或其他服务处理材料,应先在本地完成脱敏,再使用脱敏结果开展摘要、分析或其他任务。
相关阅读
常见问题
文档脱敏通常要检查哪些敏感信息?
应检查身份标识、联系方式、地址、账户支付信息、证照和业务编号,以及合同、交易和内部审批等未公开业务信息。
普通信息组合后也可能需要脱敏吗?
可能。职位、部门、时间、地点和项目名称等字段组合后,仍可能识别出具体个人、客户或业务关系。
扫描件和批注需要单独检查吗?
需要。正文之外的表格、页眉页脚、批注、修订痕迹和扫描图片都应进入同一份复核清单。