← 返回全部文章

把外部网页交给 AI 前,企业如何先做数据隔离?

本文面向需要将网页、合同、客户材料或业务文件交给 AI 的企业管理者、法务、合规人员和技术团队,说明如何在原始材料与 AI 之间建立数据隔离。你将获得一套包含敏感信息识别、人工核验、安全版本导出、端侧选择及结果复核的可执行流程。

外部网页交给AI前先做数据隔离

核心要点

  • 企业应将数据隔离放在原始材料进入处理流程之后、AI 分析之前,先识别敏感信息并生成安全版本。
  • 自动识别不能替代人工复核,用户应检查命中列表、原文位置和结果位置,并按授权范围补充或取消标记。
  • 真实敏感、涉密或断网材料适合使用桌面端;在线端会将提交内容发送至服务端完成当前请求。
  • 需要保留文本结构并在 AI 处理后恢复原值时,应使用占位符和还原字典,星号与遮蔽不支持还原。
  • 外部网页中的隐藏指令或提示注入不属于现有脱敏流程的检测范围,企业仍需人工检查材料内容和指令性文本。

把外部网页交给 AI 前,企业真正需要隔离什么

企业把网页、合同、客户材料或其他业务文件交给 AI 分析时,先要区分本次任务必需的信息与不应继续传递的内容。原始材料可能包含姓名、证件号码、联系方式、地址、金额、账户、图像标识等敏感信息。如果这些内容未经处理就与业务问题一起进入后续 AI 环节,提交范围可能超出分析所需。

外部网页还可能包含隐藏指令或其他指令性文本。企业应在提交前人工检查材料,确认其中哪些内容属于业务资料,哪些内容可能影响 AI 对任务的理解。这里的检查属于材料处理边界的一部分;现有的脱敏流程并不等同于检测或阻断提示注入,也不对这类风险作判断。

脱敏卫士 解决的是敏感信息处理环节:自动识别配置范围内的敏感内容,提供原文位置、结果位置和命中列表供用户核验,并允许停用、取消或手动增加脱敏标记,之后生成安全版本。用户可根据后续用途选择星号、占位符或遮蔽。需要保留文本结构并在内部恢复原值时,使用占位符及对应还原字典;星号和遮蔽不适用于还原流程。

实际操作中,可先在桌面端处理真实敏感、涉密或断网材料,再把安全版本交给后续 AI。由 Codex、Claude Code 等本地 Agent 编排任务时,可调用 脱敏卫士 的 Skill 或 CLI,在本地生成安全版本后继续处理。导出前仍应复核识别结果,确认处理范围符合本次任务的授权边界。

进入 AI 分析前,数据隔离应放在哪个环节

企业把外部网页、合同、法律文书、客户材料或业务文件交给 AI 前,应将隔离放在原始材料进入处理流程之后、AI 分析之前:先取得可处理的材料,再识别敏感信息,经过人工核验或自动化规则处理,生成安全版本,最后交给 AI 做摘要、提取、改写、翻译或审阅。

员工对外部网页材料中的敏感字段进行处理

网页材料不能表述为直接导入网页。在线端可粘贴网页正文,也支持 TXT、DOCX 文件导入;桌面端支持 DOC、DOCX、TXT、MD、PDF、JPG 和 PNG。若网页内容需要作为文件处理,应先保存为受支持的格式。

在产品层面,脱敏卫士 将用户的需求对应到一条可执行流程:导入或粘贴材料后,识别姓名、证件号码、联系方式、地址、金额、账户、图像标识等敏感信息;用户在核验页查看命中列表、原文位置和结果位置,停用、取消或补充标记,再导出安全版本。这样,后续 AI 接触的是处理后的内容,而不是未经核验的原始材料。

隔离范围应同时看敏感实体、AI 任务对文本结构的要求和组织内部规则。只需隐藏内容时,可使用星号或遮蔽;需要保留结构并在 AI 处理后恢复原值时,应使用占位替换并保留还原字典。星号和遮蔽不支持该还原流程。

交互式任务可在在线端或桌面端完成识别、核验并导出安全文件;Codex、Claude Code 等本地 Agent 可调用 Skill 或 CLI,在本地生成安全版本后传给后续 AI。在线端提交内容会发送到服务端完成当前请求,真实高敏感、涉密或断网材料应使用本地桌面端处理。

脱敏卫士 如何承接外部材料进入 AI 前的处理需求

把网页、合同、客户材料或其他外部文件交给 AI 前,企业可先将材料导入脱敏卫士,完成敏感信息识别、人工核验和安全版本输出。产品会按照配置范围自动识别敏感信息,并通过命中列表、原文位置和结果位置展示识别内容;组织人员可根据内部规则、授权范围和材料性质,停用、取消或手动补充脱敏标记。

材料入口取决于处理方式。在线端支持直接粘贴文本,以及导入 TXT、DOCX 文件;桌面端支持 DOC、DOCX、TXT、MD、PDF、JPG 和 PNG 文件。 如果材料由 Codex、Claude Code 等本地 Agent 编排,Agent 可调用脱敏卫士的 Skill 或 CLI,在本地生成安全版本,再把结果传给后续 AI 节点。

核验完成后,用户可选择星号、占位符或遮蔽方式生成安全版本。占位方式会保存映射关系,适用于后续还原;星号和遮蔽不保存原始字符映射。 因此,后续 AI 需要保留文档结构并支持结果恢复时,可将占位版本与还原字典配合使用;如果只需向 AI 提供不含原始敏感值的材料,则可继续使用脱敏版本。

真实敏感、涉密或断网材料可通过桌面端处理。文档正文、处理结果和字典在桌面端处理过程中不会上传;激活、更新、安全验证或基础活动统计等功能仍可能使用网络。 在线端则会通过加密通道将提交内容发送到服务端完成当前请求。企业应据此选择在线端、桌面端或本地 Agent 流程,并在导出前完成必要的人工复核。

如何复核隔离结果,避免把处理动作当成风险终点

把材料交给 AI 前,复核人员应确认识别结果是否覆盖本次任务中需要处理的敏感信息。脱敏卫士 会展示原文位置、结果位置和命中列表,用户可停用、取消或手动增加脱敏标记,再导出安全版本。 自动识别和导出只是处理流程的一部分,最终仍需结合材料性质、授权范围和组织规则人工判断。

责任人复核安全副本后再提交企业AI

复核时还应确认安全版本保留了 AI 完成任务所需的业务结构。只需阅读大意时,可使用星号或遮蔽;需要保留实体关系、编号结构并在后续恢复原文时,可使用占位替换。星号保留部分字符,遮蔽以纯色区域隐藏内容,占位替换保留映射关系并支持后续还原。 选择方式应服从任务目的,不能为减少信息而删除必要上下文。

现有证据覆盖的是已导入材料的识别、核验、补充标记和导出流程,不代表附件、文件属性或元数据已被 脱敏卫士 自动识别或清理。复核人员应另行确认这些部分是否包含敏感信息及组织规则是否要求处理;不确定时,不要直接提交给 AI。桌面端以副本作为处理来源,原文件不会被直接修改。

涉及高敏感、涉密或断网材料时,可使用脱敏卫士 桌面端。激活、脱敏、核验、还原和历史任务均可离线完成,文档正文、结果和字典不会上传。 若采用占位替换,还应分别控制安全版本与还原字典的保存和使用范围。

建立可执行的外部材料隔离流程

企业把外部网页、合同或其他材料交给 AI 前,应先为本次处理确定范围:哪些内容允许进入后续 AI,哪些内容必须保留在本地,谁负责查看识别结果并批准提交。无法确认授权范围、材料是否可提交,或某项风险无法由处理结果覆盖时,应暂停上传和后续使用,转由指定人员人工确认。

可按以下顺序执行:

  1. 保留原始材料副本,将待处理文件导入脱敏卫士。
  2. 完成识别后进入核验,查看原文位置、结果位置和命中列表;由复核人停用、取消或补充标记。
  3. 导出独立的安全版本,由复核人确认内容符合本次提交范围,再交给后续 AI。交互式流程可复制脱敏文本或导出安全文件;本地 Agent 可调用 Skill 或 CLI 生成安全版本。
  4. 如果 AI 处理后仍需恢复原始内容,使用占位替换并保留还原字典;星号和遮蔽不适用于还原。

脱敏卫士 的使用方式取决于材料边界:真实敏感、涉密或断网材料从桌面端开始处理;在线端可用于文本或文档的脱敏、核验、导出和还原,但提交内容会发送至服务端完成当前请求;本地 Agent 则适合把安全版本接入后续流程。 若无法完成核验或判断提交条件,不要把自动识别结果当作最终风险结论。

行动入口是选取一份准备交给 AI 的材料,在脱敏卫士 中完成识别与人工核验,导出安全版本后,再按材料敏感程度选择桌面端、在线端或本地 Agent 提交。

开始处理前,可先查看哪些敏感信息需要脱敏,再根据后续用途判断应采用可逆还是不可逆脱敏

常见问题

把网页内容复制给 AI 之前,企业应该先做什么?

应先保留原始材料副本,识别其中的姓名、证件号码、联系方式、地址、金额、账户等敏感信息,完成人工核验并导出安全版本,再将处理后的内容交给 AI。

在线端和桌面端处理敏感文件有什么区别?

在线端适合快速处理文本、TXT 或 DOCX,但提交内容会通过加密通道发送到服务端完成当前请求;真实高敏感、涉密或断网材料应使用桌面端,文档正文、结果和字典可在本地处理。

AI 处理后还需要恢复原始姓名或编号,应该选择哪种脱敏方式?

应选择占位替换并保留对应的还原字典。占位符能够保留实体关系和文本结构,便于后续恢复;星号和遮蔽不保存原始字符映射,不能用于还原。

为什么自动识别敏感信息后还要人工复核?

因为自动识别和导出只是处理步骤,复核人员还需确认命中范围是否符合本次任务的授权边界,停用、取消或补充标记,并检查安全版本是否保留 AI 所需的业务结构。

脱敏工具能否自动阻断网页中的提示注入?

不能据此认定可以。现有流程覆盖敏感信息识别、核验和安全版本生成,不代表能够检测或阻断网页中的隐藏指令及提示注入;企业应另行人工检查材料内容。

参考来源

  1. Google Security:公开网页中的提示注入观察(2026-04-23)
  2. 脱敏卫士官网