把文件上传到豆包前,为什么要先做脱敏?
文件上传豆包前,先分清模型训练、云端处理、对话与云盘留存、服务日志和上传授权,再用本地脱敏缩小合同、简历与财务材料的发送范围。
核心要点
- 关闭模型优化不等于文件没有上传、处理、进入历史记录或云盘。
- 脱敏卫士可在本机完成文件识别、人工复核和安全副本导出,再把副本交给豆包。
- 合同、简历和财务材料应先删除与当前 AI 任务无关的身份、账户和商业信息。
- 上传授权、平台设置、对话记录和云盘文件需要分别核查和管理。
“把这份供应合同传给豆包,让它整理付款节点,可以吗?”
真正需要判断的,不只是豆包会不会用这份合同训练模型。合同一旦上传,至少要经过网络传输、服务端解析和模型推理;如果账号保留历史对话或启用了云盘,原文件和处理结果还可能继续保存在相应空间。与此同时,合同里的联系人、银行账户、报价和技术附件,可能根本不属于上传者可以自行交给外部服务的信息。
同样的问题也会出现在招聘和财务工作中:人事把整批简历交给 AI 归纳候选人优势,财务把流水、发票或预算表交给 AI 查异常。姓名和手机号只是最显眼的部分,文件里还可能有身份证号、家庭住址、薪资、银行卡号、隐藏工作表、批注、修订记录、作者信息和扫描件背后的 OCR(光学字符识别)文本层。
因此,上传前要分开回答五个问题:内容是否用于模型训练或产品优化,文件是否在云端处理,历史对话和云盘如何保存,平台是否收集必要日志,以及你是否有权把这份材料交给所用服务。关闭训练开关只回答其中一项。
本文根据截至 2026 年 8 月 2 日可访问的豆包官方中文协议和火山引擎官方文档梳理。产品设置与条款会更新,企业正式使用时仍应核对实际版本、组织合同、管理员配置和页面即时提示。
脱敏卫士提供的是“上传发生之前”的本地控制点。 对有权处理的合同、简历和财务文件,团队可以先在桌面端本机完成候选识别、人工补漏、图片区域处理和副本导出,再把完成当前任务所需的最小内容交给豆包。这样不会替代上传授权和平台管理,但能直接减少真实身份、账户、项目与交易信息进入外部服务的数据量。
先分清:你用的是哪一个“豆包”
日常聊天时,人们常把豆包 App、网页端、豆包企业版以及通过火山方舟调用的豆包模型统称为“豆包”。它们的入口、数据关系和适用条款并不相同,不能把一个入口的承诺直接搬到另一个入口。
豆包个人版:可以退出模型优化,但文件仍要进入服务
豆包《隐私政策》说明,用户可以通过对话框发送文字、语音、图片和文件,平台收集这些信息以提供智能对话等服务。这意味着,要让豆包总结一份合同,文件内容必须先被发送并处理;关闭模型优化不会把这次云端服务变成本地运行。
对于模型训练,豆包个人版提供“帮助模型改进效果”设置。官方《帮助模型改进效果 FAQ》说明,用户可按数据类型关闭开关;关闭后,对应类型的新内容数据不再用于模型效果优化,而且设置适用于整个豆包账户。相关数据类型不仅包括文本对话,也明确包括用户上传的图片、视频、文件以及相应回复。
这个开关有价值,但应准确理解其作用:它限制的是内容收到之后是否继续用于模型效果优化,不是否定为了完成当前请求而发生的收集、传输、解析和推理。
对话历史和 AI 云盘:删除一处,不一定同时删除另一处
豆包个人版的文件留存还要结合对话与云盘功能来看。现行《云盘使用须知》写明,在豆包对话内上传的文件会自动存在 AI 云盘,用户可以在云盘内删除文件;在对话中删除某个云盘文件,不影响云盘中的原文件。
这对实际操作很重要。员工以为删掉聊天窗口就完成清理,文件可能仍在云盘;反过来,只清理云盘,也应再检查历史对话是否仍保留输入、输出或可识别片段。豆包《隐私政策》提供了删除历史对话的入口,并说明用户输入、反馈等信息在未撤回、未删除或未注销账号期间会被保留,以提供持续业务功能;删除或注销后原则上删除或匿名化,但法律留存、财务审计和争议解决等情形可构成例外。
所以,团队不能把“关掉训练”“删除对话”“删除云盘文件”当成同一个按钮。它们分别对应内容用途、对话记录和文件存储。
服务日志:不要用“删掉聊天”作过度推断
豆包《隐私政策》还说明,为保障软件与服务安全运行、运营质量和效率,平台会收集设备信息以及操作、使用、服务日志;在客服和异常诊断场景中,也可能收集必要的操作、使用、服务日志或用户为证明问题提供的材料。
公开政策没有承诺“删除某次历史对话后,所有相关服务日志在同一时刻一并清除”,也没有在通用条款中逐项列出每类日志是否包含提示词、文件名或内容片段。因此,合适的结论不是断言日志一定保存了完整合同,而是:前台删除与后台必要日志属于不同处理环节,企业不能在没有合同和技术说明的情况下把两者视为等同。
如果材料属于高敏合同、未公开财务数据或成批候选人简历,管理员应进一步向服务方确认具体账号形态下的日志内容、访问权限、保留期限、删除机制和例外,而不是依赖普通用户界面的表面状态。
豆包企业版:组织控制数据,也承担授权和治理责任
豆包《隐私政策》把企业版单独列出。用户基于组织身份账号产生的输入、上传数据、设置和使用记录属于“组织使用数据”,受所在组织控制;豆包根据组织指示及双方协议处理。政策同时要求组织取得必要、充分的授权,并提醒用户遵守组织的信息管理要求。
但企业版也有账号条件差异:政策特别说明,使用飞书基础版账号登录豆包企业版的用户,其上传及产生的数据将用于提升豆包企业版的使用体验。不能把“组织控制”概括成所有企业账号完全相同;采购和管理员应核对实际飞书账号版本、组织协议和控制台说明。
这与个人版的关系不同,但不等于“用了企业版就可以上传任何文件”。企业仍要判断:客户合同是否允许交由该服务处理,招聘简历的用途是否覆盖这次 AI 分析,财务材料是否受内部数据分级和供应商管理制度限制,管理员是否配置了合适的成员权限、离职回收和分享规则。
企业版降低的是未经组织管理的个人使用风险,不会自动替组织完成合法性基础、最小必要、供应商评估和内部审批。
火山方舟:默认不训练基础模型,不等于没有数据处理与审查
如果企业通过火山方舟调用豆包模型,适用的是火山引擎平台、模型服务及订单合同等规则,不能照搬豆包个人版开关。
火山引擎当前《模型服务协议》第四条“数据访问和使用”的 4.1 说明:除非客户单独同意,服务不使用客户提交或服务输出的内容训练、重新训练或改进基础模型;单独同意数据授权或参加协作奖励计划属于列明例外。4.2 则说明,为履行法定合规要求,火山引擎可采取技术手段审查使用行为及信息,包括对输入和输出进行自动化过滤审核,建立和改进风险过滤机制与违法违规内容特征库。
这里不能把某个特定模型或活动的数据授权页面泛化为所有豆包模型调用的通用授权。企业采购和技术负责人应直接核对本账号、订单和控制台实际呈现的单独授权文件、奖励计划以及具体模型与功能规则。
同样地,默认不训练基础模型只回答训练用途。API 请求仍要到云端完成推理,合规审查、账号鉴权、计量、安全运维和客户自建应用日志也需要分别治理。对于日志字段、留存、内容审核、知识库或插件产生的派生数据,应以企业订单、数据处理协议、控制台配置和所用功能文档为准。
关闭训练之后,原始文件还经过哪些环节
以一份包含真实客户名称、经办人手机、收款账户和底价的采购合同为例,把原件拖进豆包后,风险不是集中在“训练”一个终点,而是分布在整条链路。
传输和云端解析
文件先从浏览器或 App 离开本机,再由服务处理。DOCX 可能包含批注和修订,PDF 可能有附件和 OCR 文本层,表格可能有隐藏工作表、公式、批注及外部链接。即使用户只想让 AI 看正文,实际上传的仍可能是整个文件容器。
加密传输可以保护网络传输过程,却不能替代上传授权和内容最小化。文件已经送达服务端这一事实,不会因为关闭模型训练而改变。
对话、文件和派生结果
平台为了支持连续追问,会展示并保留历史对话;文件可能进入云盘,摘要或分析结果还会形成新的文本。员工又可能把结果复制到邮件、群聊、工单或新的 Word 文档,造成更多副本。
对简历而言,即使原始附件后来删除,模型输出中仍可能出现候选人姓名、现单位、薪资和评价。对财务材料而言,输出可能重新列出银行账号、交易对手或异常交易。清理时必须同时检查输入、文件、输出和后续流转位置。
安全审查、日志和支持流程
普通端政策说明会收集安全运行所需的日志,火山方舟协议也说明会采用技术手段进行合规所需的自动化过滤审核。它们不等于平台必然泄露数据,也不能据此推断日志一定含有完整原文;但它们足以说明,训练开关不能覆盖安全审查、异常排障、投诉和法定留存等处理。
如果员工把真实合同附在客服工单中证明故障,处理范围还会再次扩大。上传前的控制应当覆盖整个工作流,而不仅是模型设置页。
授权与组织责任
豆包个人版《用户协议》要求用户保证输入内容拥有相应权利或已经取得权利人合法授权,不侵犯他人的个人信息权益等合法权益;《隐私政策》也要求,输入包含他人个人信息时,应在提供前取得合法授权;《云盘使用须知》则要求用户对上传、存储和分享行为负责。三份文件各自支撑输入授权、个人信息和云盘行为,不能合并成同一结论来源。
一名员工能访问文件,不代表他有权把文件交给任意外部 AI。合同中的保密条款、客户指示、招聘告知、员工隐私制度、财务权限和供应商清单,可能对这条数据流设置额外限制。平台负责依法处理收到的数据,不会替上传者取得客户、候选人或交易相关方的授权。
文件看起来已经打码,为什么仍可能不安全
很多上传事故不是因为用户完全没做处理,而是因为处理只发生在屏幕上。
黑色矩形可能只是覆盖层
在 PDF 或演示文稿中画一个黑框,底层文字可能仍可选中、复制、搜索或提取。删除截图里的姓名,也不一定删除图片文件的 EXIF 信息。真正的安全脱敏应处理文件内容和结构,而不是只改变视觉效果。
隐藏内容不在当前页面上
需要检查的内容通常包括:
- Word 的修订记录、批注、页眉页脚、文档作者与公司属性;
- Excel 的隐藏工作表、隐藏行列、单元格批注、公式、命名区域与外部链接;
- PDF 的 OCR 文本层、批注、表单字段、附件、书签与元数据;
- 图片中的证件、签名、二维码、车牌以及文件属性;
- 多文件之间能够拼接身份的项目名、日期、单位、金额和事件细节。
这正是“删掉姓名和电话”仍不够的原因。一份简历隐去姓名后,现公司、毕业年份、罕见项目和精确入职日期仍可能共同指向特定候选人;一份合同隐去甲乙方后,合同编号、开户地址和独家产品名仍可能暴露主体。
脱敏不等于匿名化,也不等于自动获得授权
脱敏能缩小暴露范围,却不保证在任何背景下都无法重新识别。对高风险数据,组织还要评估剩余上下文、文件组合和接收方掌握的外部信息。
同样,技术处理不能替代审批。材料即使已经脱敏,仍可能包含受限商业信息或不适合进入普通消费端的内容。国家秘密、核心数据、重要数据、未公开重大交易信息或组织明确禁止外发的材料,不应因为“已经打码”就直接上传。
上传豆包前的七步检查
下面这套流程可以同时用于合同、简历和财务材料。贯穿原则是:先确定任务真正需要什么,再只发送完成任务所必需的脱敏副本。
第一步:确认入口、账号和功能
记录使用豆包个人版、豆包企业版,还是火山方舟 API;核对是否登录、是否开启帮助模型改进、是否启用记忆、历史对话、AI 云盘或分享功能。火山方舟还要核对模型服务协议、是否另行同意数据授权、是否参加奖励计划以及所用插件、知识库的单独规则。
第二步:确认有权上传
检查客户合同、保密协议、招聘告知、个人信息处理规则、财务权限和公司 AI 使用制度。账号由公司提供,不代表文件自动获得外发授权。无法确认时,先停止上传并找项目负责人、法务、合规或信息安全人员确认。
第三步:缩小任务范围
让 AI 总结付款节点,通常不需要整份合同的签字页、开户资料和技术附件;比较候选人技能,未必需要身份证、住址和个人手机号;分析费用趋势,可以先删除账户号、客户名和逐笔备注。能用片段、字段表或合成样本完成,就不要发送完整原件。
第四步:建立敏感信息清单
至少覆盖姓名、电话、邮箱、住址、证件号、银行账号、签名、单位、客户与供应商、合同编号、项目代号、金额、未公开指标、批注、修订、隐藏表格和元数据。对同批关联文件,还要找出能够跨文件拼接身份的线索。
第五步:在本机生成脱敏副本
保留受控原件,只在副本上操作。把固定格式字段、语义实体和图片区域分别处理;根据任务选择涂黑、星号、稳定代指或合理的数值变换。需要 AI 理解主体关系时,稳定代指往往比把所有内容涂成黑块更有用,例如把同一家公司一致替换为“<机构1>”。
第六步:从最终文件反向验证
不要只看预览图。搜索原姓名和公司名,尝试复制粘贴与文本提取,检查文件属性、修订、批注、隐藏工作表、附件、链接和 OCR 层;确认导出的文件不含原始映射。再让不参与处理的人按清单复核一次,特别检查误脱和漏脱。
第七步:上传并管理后续副本
只把最终脱敏副本发送到已经批准的账号和工作区。不要随意生成公开链接;任务完成后,按组织规则分别检查历史对话、AI 云盘、生成结果和本地临时文件。记录使用目的、文件版本、审批人、平台入口和删除动作,便于后续核查。
脱敏卫士怎样放在豆包之前
脱敏卫士(RedactOS)桌面端可以把“导入—识别—人工复核—导出”放在文件进入豆包之前完成。桌面端在本机运行,文档、处理过程、任务记录和还原关联信息留在本机,并支持断网使用;适合不能先把真实敏感材料上传公网的合同、简历、审计和财务文件。
桌面端支持 DOCX、TXT、文字型 PDF、扫描型 PDF 和图片。识别时,可以把固定格式字段的规则与依赖上下文的 AI/NER 识别组合使用,覆盖姓名、机构、地址、证件号、手机号、邮箱、银行卡号、统一社会信用代码、合同编号、司法案号、金额、日期、网址和 IP 等常见类型。
自动识别不是“百分之百无遗漏”的承诺。处理结果需要人工复核:误报可以取消或加入白名单,漏报可以划词补充,图片和扫描材料可手动框选区域,高频特殊字段可沉淀为自定义规则或黑名单。正式导出前,仍应执行前述反向验证。
对于需要继续让豆包分析的合同,可以选择混淆代指,把公司、联系人、地址和账户替换为稳定的类型标记,尽量保留条款结构和前后指代。同批合同、补充协议和附件中的同一实体还可以沿用一致代指,减少模型把同一主体误解为多个人或多家公司。财务数值可按任务采用加、减、乘、除偏移,但必须确认变换没有破坏比例、阈值、税率或其他分析条件。
一个完整闭环可以是:
- 在本机导入原始合同、简历或财务文件;
- 启用所需规则和语义识别,处理可见内容与图片区域;
- 人工复核误报、漏报和仍可组合识别的上下文;
- 导出仅含任务必要内容的脱敏副本,再上传豆包;
- 将豆包生成的摘要或分析结果带回受控环境;
- 如业务确需恢复代指,从原任务在本机执行还原,并保护任务记录和映射信息。
如果团队使用支持 Skill 的本地 AI Agent,也可以评估把脱敏卫士的本地能力放到后续 AI 任务之前。要继续守住两个边界:本地调用只说明脱敏步骤在本机执行,不代表后续豆包、火山方舟或其他模型也在本地;实际文件访问权限、日志、复核和脱敏结果发送位置仍由 Agent 配置决定。
映射表和任务内还原信息也不是普通附件。它们保存了代指与原文的对应关系,应与原件同等级保护,限制谁能查看、导出和执行还原,不能和脱敏副本一起无控制地发给外部服务。
其他国内模型可以怎样横向核对
不同平台的普通端、开放平台和企业服务同样不能混写。横向比较时,至少查训练或优化用途、退出方式、服务端处理、历史记录、日志、删除规则和输入授权,而不是只找一句“保护隐私”。
例如,DeepSeek 当前官方用户协议要求上传者拥有处理输入所需的权利、许可和权限,输入不得涉及国家秘密、商业秘密等数据;普通端可关闭“数据用于优化体验”,关闭后输入和输出不再用于模型训练。Kimi 当前官方用户协议则要求,输入涉及他人个人信息时取得相应授权,涉及商业信息尤其是商业秘密时应有权处理,并在上传前进行必要脱敏。
这些条款可以作为检查思路,不能用来替豆包下结论。使用千问、DeepSeek、元宝、Kimi、文心或其他服务时,应重新核对对应入口当日有效的官方协议、隐私政策和管理员设置。
常见问题
1. 已关闭“帮助模型改进效果”,上传前还需要脱敏吗?
通常仍需要。关闭开关限制对应内容继续用于模型效果优化,不会取消完成当前任务所需的云端传输、解析和推理,也不会替你取得合同相对方、候选人或交易相关方的授权。应先判断任务是否必须使用真实字段,再只发送必要的脱敏副本。
2. 怎么判断该按个人版、企业版还是火山方舟规则评估?
看实际入口和法律关系,而不是只看模型名称:个人自行登录 App 或网页通常先查个人版;通过组织身份使用豆包企业版,要查组织协议与账号类型,尤其确认是否为飞书基础版账号;开发者通过 API 或控制台调用,则查火山方舟订单、模型协议和功能规则。混用多个入口时要分别评估每段数据流。
3. 任务完成后,删除对话还是删除 AI 云盘文件?
两处都应按实际情况检查。对话删除和云盘文件删除是独立动作;还要检查生成结果、分享链接和下载到本地的临时副本。不要因为前台已看不见,就推断必要日志、法定留存或争议材料已经同步清除。
4. 哪些材料不应进入普通外部 AI?
国家秘密、核心数据、重要数据、组织明确禁止外发的材料,以及未获批准的商业秘密、未公开重大交易信息和高敏个人信息,不应因“关了训练”或“做了简单打码”就上传。拿不准数据级别或授权范围时,应先暂停并交由法务、合规或信息安全人员判断。
5. 文件脱敏后,还需要哪些审批和验证?
至少确认组织批准使用该入口、处理目的与原授权一致、发送范围符合最小必要;导出后再搜索原敏感词,测试复制与文本提取,检查元数据、批注、修订、隐藏工作表和 OCR 层。映射、还原信息及 AI 输出也要单独控制权限,不能与脱敏副本一起无控制流转。
最后,把问题换一种问法
“豆包会不会训练我的文件”太窄,也没有一个适用于所有入口的固定答案。
更稳妥的问题是:我现在用的是个人版、企业版还是火山方舟?这份文件是否必须完整上传?平台为完成任务会怎样处理和保存内容?模型优化开关、对话历史、云盘文件和服务日志分别如何管理?我是否有权把其中每一类信息交给这项服务?
对合同、简历和财务材料而言,最稳定的控制点仍在点击上传之前。先把不影响任务的真实身份、账户、项目和交易细节留在本机,再让模型处理必要的脱敏副本。这样不能消除平台、权限、输出准确性和重新识别的全部风险,却能显著减少原始敏感信息进入外部传输、存储、审查和分享链路的范围。
效率可以交给 AI,完成任务不需要的真实信息,不必一起上传。
说明:本文由脱敏卫士团队发布,用于介绍文件上传 AI 前的数据最小化与本地脱敏方法,不构成具体法律意见。豆包、火山方舟及其他平台规则核查至 2026 年 8 月 2 日;产品、协议和控制台设置可能更新,正式使用前请再次核对官方页面、组织合同和管理员配置。
下一步: 可先查看脱敏卫士的本地识别、人工复核与导出能力,再用虚构或已获授权的非敏感样本在线体验。真实合同、简历和财务文件应优先使用桌面端在本机生成脱敏副本。
相关阅读
参考来源
- [豆包隐私政策]():更新 2026-07-15,生效 2026-07-22。智能对话会收集用户发送的文字、语音、图片、文件以提供服务;个人版用户可关闭“帮助模型改进效果”;上传内容、访问使用情况可在满足政策所述保护条件下用于分析和模型训练。政策同时说明历史对话删除入口、输入等信息的存储期限原则、删除/匿名化及法律留存、财务审计、争议解决例外;为安全运行收集操作、使用、服务日志。
- [帮助模型改进效果 FAQ]():可按内容类型退出模型效果优化;关闭后对应内容不再用于模型效果优化,设置在 App、PC、网页端按整个账号同步;文件、图片、视频及相应回复属于可单独控制的数据类型。
- [豆包用户协议]():更新 2026-07-15,生效 2026-07-22。用户需保证输入拥有权利或已获得合法授权,不侵犯个人信息权益等第三方权益。
- [豆包云盘使用须知]():该页面是“对话内上传文件自动存在 AI 云盘”的直接依据;在对话中删除文件不影响云盘文件;云盘文件分享与删除需单独管理。
- [模型服务协议]():以 2026-08-02 直接抓取当前页面正文核验。第四条“数据访问和使用”4.1 说明,除非客户单独同意,服务不使用客户提交或输出内容训练、重新训练或改进基础模型;4.1.1、4.1.2 列出同意数据授权协议或参加协作奖励计划两类单独同意。4.2 仅支持“采取技术手段”审查,并明确包括对输入和输出的“自动化过滤审核”;当前页面不支持“人工手段”表述。
- [机器学习平台专用条款]():火山方舟属于机器学习平台服务功能,具体使用同时受服务条款、产品和服务协议、订单、SLA 与服务规则约束。
- 排除来源:[页面 1359327]()当前标题为“豆包生视频模型使用规则及数据授权使用协议”,适用于页面明确的豆包生视频模型服务,不能据此概括所有豆包模型调用,故正文不引用其授权范围。
- [DeepSeek 用户协议](),更新及生效 2025-09-05:要求上传者拥有处理输入所需权利、许可和权限,输入不得涉及国家秘密、商业秘密等;普通端可关闭“数据用于优化体验”,关闭后输入输出不再用于模型训练。
- [Kimi 用户服务协议](),版本更新及生效 2025-04-28:输入涉及个人信息需取得知情同意,敏感个人信息需单独同意或采取合法匿名化;商业信息尤其商业秘密应有权处理,并在上传前进行必要脱敏。