← 返回全部文章

断网或保密机房里的材料,怎样在桌面端完成本机处理

断网只解决外联,不会自动完成材料处理。本文按终端准备、文件导入、实体识别、人工复核、实际导出和任务交接六个环节,说明如何用脱敏卫士桌面端把高敏材料留在本机处理,并核对下一段数据流。

断网保密机房内在桌面端处理高敏材料的丝网版画场景

核心要点

  • 断网只是外联条件,本机处理还要覆盖原件、识别过程、任务记录、还原信息和最终导出物。
  • 脱敏卫士桌面端可在本机完成文档导入、识别、人工复核和导出,且数据不出机并支持断网使用。
  • 自动识别用于缩小检查范围,正式交付前仍要对照原文、脱敏结果和项目清单处理误报与漏报。
  • 脱敏副本进入模型、共享盘或其他工具后,发送位置、权限、日志和留存需要重新核对。
断网或保密机房里的材料,怎样在桌面端完成本机处理

电脑没有联网,不等于材料已经完成安全处理。它只解决了外联这一层:原文件放在哪里、识别过程是否留在本机、结果怎样复核、导出后会被带到哪里,仍然要逐项确认。

对断网办公室、保密机房或禁止把材料上传到服务器的团队,真正需要检查的是一条完整链路:原始材料进入哪台终端,处理过程和任务记录保存在哪里,谁负责复核,最终只带走哪一份副本。只盯着“有没有网”,很容易漏掉导出物和还原信息这两个出口。

脱敏卫士桌面端在本机运行,文档、处理过程、任务记录和还原关联信息留在本机,数据不出机且断网可用。下面就按实际工作顺序,把这条链路拆开。

断网办公桌上的经办人正在本机处理一组高敏材料

这一步要看的不是网络图标,而是原件、处理终端和安全副本是否处在清楚的边界里。

先核对真正的数据边界

开始前,先把“本机处理”说具体。至少要覆盖五类对象:原始文件、解析与识别过程、脱敏任务记录、还原关联信息、最终导出物。前四类留在受控终端内,并不代表第五类可以不受限制地流转。

这也是断网环境最常见的误判:处理时没有外传,于是默认导出的 U 盘、移动硬盘或后续工作站也天然安全。实际上,桌面端能保证的是脱敏环节的数据边界;文件导出后交给哪台电脑、哪个模型、哪个共享系统,取决于后续流程,必须另行确认。

因此,建议在操作前由经办人和安全负责人确认四件事:哪台终端可以处理,原件从哪里进入,安全副本从哪里离开,任务记录和还原权限由谁掌握。这里不需要先写一份很长的制度,先把本次任务的入口、出口和责任人写清楚就够了。

如果团队还在比较在线与离线方案,可以先看敏感文档不上传云端时的处理边界。在线体验适合了解流程,真实敏感、涉密或禁止外联的材料,应优先按桌面端的本机边界来评估。

把材料和终端准备好

RedactOS 桌面端支持 Windows x64、macOS Apple Silicon 和 macOS Intel。进入断网环境前,应先确认将要使用的安装包、授权状态和终端系统是否匹配;知识库没有登记离线环境下首次激活、续期和升级的具体边界,因此这些动作不要留到材料已经进入机房后再临时猜测。

接着盘点文件。桌面端支持粘贴文本,也支持 .docx、.txt、文字型 PDF、扫描型 PDF 和图片。单个文件可以走单篇流程,多份文件可以进入批量流程。批量导入没有一个可以脱离设备条件承诺的固定数量,实际规模取决于系统配置和可用资源。

这意味着“能选中很多文件”和“适合一次全部跑完”不是一回事。对首次处理的材料,先挑一小组有代表性的样本:一份可编辑文档、一份扫描件、一张图片,以及一份包含组织特有名称或编号的材料。用它们验证识别、复核和导出,再决定批量范围。

文件准备还应保持最小化。只把本次要处理的材料带入工作目录,原件与工作副本分开,导出目录提前清空或单独建立。这样可以减少选错文件、覆盖原件或把未处理版本混入交付目录的机会。

在桌面端完成导入、识别和方式选择

进入“信息脱敏任务”后,可以粘贴文本或选择文件。没有输入时,“开始脱敏”不会执行;材料进入后,再根据本次用途选择需要识别的实体类型,而不是每次无差别开启全部项目。

固定格式字段与上下文实体的识别方式不同。身份证号、手机号、邮箱、案号、合同编号等结构相对稳定的内容,主要由正则规则处理;姓名、地址、单位或机构等依赖语境的内容,则由 AI/NER 辅助识别。组织内部项目号、客户简称和必须处理的特殊词,还可以通过自定义规则或黑名单补充;必须保留且容易误判的词,可用白名单保护。

输出方式也要在处理前想清楚。涂黑适合外发或公开展示,星号用于隐藏字段的一部分,混淆代指则保留人物、单位、地址等实体类型和上下文结构。后续如果还要摘要、检索或分析,代指通常更便于阅读;如果只需要给人查看一份公开副本,涂黑可能更直观。无论选哪一种,正式导出前都要复核。

处理多种格式或一组关联文件时,可以进一步参考混合格式材料的批量脱敏步骤。重点不是追求一次放入最多文件,而是先确定同一批材料使用相同的实体范围、输出方式和复核口径。

用真实界面对照原文、结果和命中清单

识别完成后,不要只看“任务已完成”。真正有价值的界面,是把原文、脱敏结果和脱敏列表同时摆出来:左侧检查原始位置,中间检查替换后的语句,右侧检查每一类命中及其启用状态。

脱敏卫士桌面客户端对照原文、占位替换结果和脱敏项目清单

重点对照同一处内容在原文、结果和清单中的对应关系,而不是只看命中数量。

从这个界面开始,复核人员可以按三轮检查。第一轮看明显误报:本来需要保留的词是否被替换。第二轮看明显漏报:姓名、地址、机构、联系方式和组织特有编号是否仍出现在结果中。第三轮看语义:替换以后,人物、单位、金额和事件关系是否还足够支持后续用途。

命中数量高不等于结果更好。一个应该保留的日期被处理,可能让材料失去时间线;一个没有命中的内部项目号,也可能让外发副本留下关键线索。复核的目标不是让右侧列表越长越好,而是让处理范围与本次用途一致。

人工处理误报和漏报,再导出

RedactOS 的定位是自动识别、人工复核和规则持续优化的工作台,不承诺一次自动识别就达到 100%。处理完成后,可以在脱敏项目清单里关闭不需要的项目;发现文字遗漏时可划词补充,图片材料还可以手动框选区域。高频遗漏可以再沉淀为自定义规则或黑名单,频繁误报则可以通过白名单减少重复操作。

完成界面复核后,还要验收实际导出文件。原因很简单:经办人最后交付的是文件,不是软件里的预览。打开导出结果,至少完成以下检查:

  • [ ] 搜索一组已知姓名、手机号、证件号和内部项目词;
  • [ ] 逐页检查扫描页、图片区域、页眉页脚和附件页;
  • [ ] 确认外发版采用了约定的涂黑、星号或代指方式;
  • [ ] 检查导出文件名、格式和数量是否与任务清单一致;
  • [ ] 确认导出目录里没有原件、临时文件或未处理版本。

如果结果需要保留实体关系,导出前还应检查代指是否一致;如果结果只用于公开展示,则要检查遮盖位置和页面可读性。两种用途的验收标准不同,不能拿同一份“看起来都遮住了”作为结论。

把任务记录和还原能力留在受控边界内

桌面端的每次脱敏会形成任务记录。历史项目可用于查找已完成任务、继续复核、重新导出,或从对应任务进入还原。这减少了经办人另存技术性还原文件、再手工配对的负担。

方便不等于可以放宽访问。任务记录和还原关联信息仍能连接脱敏结果与原内容,应该继续留在受控终端和明确的权限范围内。若另行导出脱敏映射表,也不要把它与脱敏结果放进同一个无差别交付包。

还要再次区分两段链路:桌面端负责在本机完成材料处理;脱敏结果离开桌面端后,是否上传模型、写入共享盘、进入日志或长期留存,由下游工具和组织流程决定。需要可逆还原的团队,可以再核对可逆与不可逆脱敏的选择边界,先决定谁确实需要恢复能力,再决定任务和导出物怎样分开管理。

一份可直接使用的离线处理清单

进入断网环境前:

  • [ ] 已确认桌面端系统、安装、授权与设备条件;
  • [ ] 已列出本次允许进入终端的文件,并准备工作副本;
  • [ ] 已明确原件入口、安全副本出口和责任人;
  • [ ] 已约定导出介质、交接对象和后续使用位置。

在桌面端处理时:

  • [ ] 已按材料用途选择识别实体,而不是盲目全选;
  • [ ] 已确定涂黑、星号或混淆代指的输出方式;
  • [ ] 已用代表性样本验证扫描件、图片和可编辑文档;
  • [ ] 已对照原文、脱敏结果和项目清单处理误报与漏报。

导出和交接时:

  • [ ] 已打开实际导出文件进行搜索和逐页检查;
  • [ ] 已核对文件数量、格式、命名和交付目录;
  • [ ] 已把原件、脱敏副本、任务记录和还原信息分开;
  • [ ] 已确认脱敏副本进入下游工具后的数据位置、权限、日志和留存。

断网不是流程的终点,而是把处理边界收回本机的起点。脱敏卫士桌面端可以把导入、识别、人工复核、导出和任务记录放在同一台受控终端上;真正的闭环,则来自经办人对实际导出物的验收,以及对下一段数据流的再次确认。

需要处理真实敏感或禁止外联的材料时,可从脱敏卫士官网了解桌面端,并先用不含真实敏感信息的样本验证本单位的终端、规则和交接流程。

常见问题

电脑断网后,材料就算完成安全处理了吗?

不算。断网只控制外联,还要确认原件、处理过程、任务记录、还原信息和最终导出物各自在哪里、由谁访问。

桌面端可以处理哪些文件?

当前产品知识库确认桌面端支持粘贴文本,以及导入 DOCX、TXT、文字型 PDF、扫描型 PDF 和图片。

自动识别完成后还需要人工检查吗?

需要。识别会受文件质量、上下文和规则影响,正式导出前应处理误报、补上漏报,并检查实际导出的文件。

本机脱敏后可以直接把结果交给任意模型吗?

不能直接这样推断。脱敏结果进入其他模型或工具后的发送位置、权限、日志和留存,仍需按实际下游流程单独确认。

参考来源

  1. 脱敏卫士官方博客:敏感文档不上传云端时的本机处理边界
  2. 脱敏卫士官方博客:混合格式材料的批量脱敏步骤