← 返回全部文章

把案卷交给大模型前,先在本地脱敏再让后续任务用安全版本

文件能被大模型读取,不等于已经适合提交原文。应先在本机完成识别和复核,并用混淆代指保留结构,核对后再把脱敏副本交给后续摘要或问答;映射表不要和结果一起进入提示词。

先在本机处理案卷敏感栏再交给后续分析

核心要点

  • 能读取不等于适合提交原文,交给模型前应先形成脱敏副本。
  • 真实敏感材料优先桌面端;Skill 或 CLI 只保证脱敏这一步在本地。
  • 交给模型时优先使用混淆代指,保留实体类型和句子结构。
  • 识别之后仍须复核漏脱和误脱,映射表不能和结果一起进入提示词。

把合同、案卷或工单交给大模型做摘要、问答或比对时,最先被跳过的一步,往往是直接上传原文。文件能被模型读取,不等于这份材料适合离开本机。

能打开只说明格式和文字层可用。交给模型前要回答的是另一件事:姓名、证件、联系方式、地址、案号和商业秘密,是否已经按这次用途处理完,并且经过人工核对。

脱敏卫士把这一步放在后续分析之前:先在本机识别和处理,再让摘要、问答或其他任务使用脱敏结果。还原是受控环境里的后续动作,不是把原文和结果一起交给模型。

能读取不等于适合交给模型

原文一旦进入提示词、知识库切片或训练样本,撤回路径会变长。删掉对话窗口里的文件,不等于模型侧、日志侧和缓存侧都已经清除。

《个人信息保护法》要求处理目的明确、与目的直接相关,并采取对个人权益影响最小的方式。把含身份信息的案卷交给模型做摘要,应先确认这次用途是否需要原文身份。《生成式人工智能服务管理暂行办法》对预训练和优化训练数据的来源、知识产权、个人信息和数据质量提出要求,同时也划了适用范围。未向境内公众提供服务的内部研发,并不当然适用该办法的全部条款。具体项目适用哪些规则,要由组织结合业务形态判断,不能靠一篇操作说明给出一律可以或一律不行的结论。

因此,交给模型前需要的是一份按用途处理过的副本,而不是默认提交原文。字段范围可先对照需要脱敏哪些敏感信息;这里只把顺序说清。如果后续任务并不需要真实姓名或案号,就不应把这些字段送进提示词,只为了让模型“读得更完整”。

先在本机处理,再决定后续链路

真实敏感、涉密或断网环境里的材料,应优先使用桌面端。桌面端在本机完成导入、识别、复核和导出,文档和处理记录留在本机。在线体验版适合了解文本脱敏和代指流程,不是处理全部真实敏感原文的默认形态。需要在保密机房或禁止外联环境处理时,可继续看离线桌面端怎么完成本机脱敏

如果后续分析由本地 Agent 自动执行,可以用 Skill 把本机脱敏接进支持 Skill 的 Agent,或用 CLI 在终端和脚本里调用。当前产品资料没有给出安装地址、完整参数和已验证兼容矩阵,具体命令以对应版本说明为准。不能把“支持 Skill 的 Agent 可以调用”写成“兼容所有 Agent、所有系统”。

更关键的边界是:Skill 或 CLI 只保证脱敏这一步在本地执行。脱敏结果会不会再发给第三方模型、云服务或其他工具,取决于后面选择的 Agent、模型和工作流。安全负责人仍要确认发送位置、文件访问范围、日志和留存。本地脱敏完成,不等于整条分析链路都还在本机。

交给模型时优先保留结构

给模型用的文本,通常需要保留人物、机构和动作之间的关系。把所有姓名、单位和金额直接清空,句子可能读不通,后续摘要也会失去结构。

脱敏卫士提供涂黑、星号遮盖和混淆代指。涂黑适合给人看的外发件。星号可保留部分前后字符。混淆代指使用人物、地址、证件一类标记,保留类型和句子结构,更适合复核、任务内还原,以及交给模型做摘要、问答或检索。当后续任务需要理解谁对谁做了什么时,代指通常比星号更容易读。

界面里可以直接切换星号替换和占位替换。占位替换对应代指标记。选择应由这次后续任务决定,而不是所有材料都用同一种方式。交给模型前,仍要复核;方式本身不会补上没核对的漏项。可逆和不可逆处理的差别,见可逆脱敏和不可逆脱敏差在哪

任务栏中可切换星号替换和占位替换

先确认后续任务要不要保留实体关系,再选占位替换;不要默认用星号把结构也抹掉。

工作台会同时给出原文、占位结果和右侧清单。这一屏用来对照同一实体有没有换成稳定标记,不是用来证明已经可以提交给模型。

工作台同时展示原文、占位替换结果和脱敏清单

核同一人物、同一单位是否沿用同一标记,再把结果交给后续任务。

识别之后仍要复核

固定格式字段主要由正则处理,姓名、地址、机构和律所等由 AI/NER 识别。可以按本次用途选择实体类型,不必一次打开全部识别项。命中来源可以区分是规则还是模型,便于判断该不该保留。

识别结果仍是候选。产品不承诺一次自动全部处理干净。漏掉证件号,原文身份会进模型;误伤必须保留的业务用语,后续分析又会失真。正式把结果交给后续任务之前,要打开清单:误脱关掉或加入白名单,漏脱划词补充,图片还可以框选。

脱敏列表按类别开关识别项并对照替换结果

交给模型前看当前启用了哪些项。关掉的是误脱,补上的是漏脱,不要只看结果区已经变成标记。

批量处理一组关联材料时,还要确认同一实体有没有沿用同一套代指。跨文件标记不一致,模型汇总时可能把同一人认成两个人。映射表对应原文,属于敏感信息,不要和已经脱敏的副本一起塞进提示词或知识库。

先在本机盖住敏感字段,再把保留结构的副本交给后续分析

模型读到的应是核对后的副本。原文留在本机任务里,需要时再受控还原。

交给模型前先完成本机处理的四步

脱敏在本机完成。后续模型会不会再离开本机,要另外确认。

用一份待分析材料验收一次

把一份真实要交给模型的合同或案卷放进桌面端后,可以按下面几项勾选:

  • 入口是桌面端或本机 Skill/CLI,而不是把真实敏感原文直接贴进云端对话框
  • 输出方式是代指或占位替换,句子结构还在,不是把全部字段掏空
  • 清单里误脱已关掉,漏脱已补上,同一实体跨段落标记一致
  • 交给后续任务的是脱敏结果;映射表和原文没有一起发出去
  • 已确认后续模型、Agent 或知识库会接收哪一份副本,以及结果会不会再离开本机

脱敏卫士在交给大模型前承担本机处理工作台,不代替判断这次分析是否允许使用该材料,也不保证后续模型链路仍在本地。要用手头材料走一遍,可从脱敏卫士进入信息脱敏任务。

常见问题

直接把 Word 或 PDF 丢进对话框,模型能打开就可以吗?

还不够。能读取只说明格式可用。原文身份、联系方式和案号仍可能进入提示词或日志,应先在本机脱敏并复核。

用了 Skill 或 CLI,后续分析是不是都在本机?

不是。Skill 或 CLI 只保证脱敏这一步在本地执行。结果会不会再发给第三方模型,取决于后面的 Agent 和工作流。

交给模型应该选涂黑、星号还是占位替换?

后续摘要或问答通常更适合混淆代指即占位替换,因为它保留类型和句子结构。涂黑更适合给人看的外发件。

映射表要不要和脱敏文本一起贴进提示词?

不要。映射表对应原文,属于敏感信息。交给后续任务的应是脱敏副本,还原只在受控环境里进行。

参考来源

  1. 《中华人民共和国个人信息保护法》
  2. 《生成式人工智能服务管理暂行办法》