中文扫描件 AI OCR 实战:从识别、复核到脱敏与外部 AI 使用
面向中文扫描件的 AI OCR 实战指南:拆解图像预处理、版面与表格识别、字段抽取、低置信度复核、脱敏、导出和反向验证,并给出六类文档测试矩阵与验收指标。
核心要点
- OCR 只是把图像转成可定位文字,不能替代字段判断、脱敏和最终文件验收。
- 脱敏卫士可在本机导入扫描型 PDF 和图片,结合规则、AI/NER 与人工框选处理敏感内容。
- 低置信度、手写、印章、复杂表格和多栏版式必须进入人工复核队列。
- 上传豆包等外部 AI 是新的数据边界,只能使用已验收的最小必要副本。
一份盖过章、复印过两次的中文合同,对软件而言可能只是由灰点、阴影和线条组成的图片。页眉公司名、正文身份证号、表格账号或骑缝章下的金额识别错误,都可能在后续抽取或脱敏时变成漏项。
因此,AI OCR 的任务不应被概括成“把扫描件转成文字”。严谨的目标是:把原始图像转换为可定位、可校正、可追溯的文字与结构,在明确下游用途后识别敏感字段,经人工复核完成脱敏,再对导出文件做反向验证。若结果随后要交给豆包等外部 AI,上传又是一个新的数据流,不能因为前面的 OCR 或脱敏在本地完成,就把后续服务也视为本地处理。
脱敏卫士把 OCR 结果带回“候选识别—人工复核—安全副本”这一条可操作链路。 对文字型或扫描型 PDF 和图片,桌面端可在本机组合固定规则与 AI/NER 标记候选字段,复核人员再处理低置信度、签名印章和复杂图片区域。它不追求用一个准确率覆盖全部文档,而是让高风险页面能够停下来、补标并被验收。
先分清五件事:OCR 不是完整的文档理解
中文扫描件处理至少包含五层任务,它们可能由同一套软件串联,也可能来自不同组件,但验收时必须分开。
- 图像预处理修正旋转、透视、噪点、阴影、黑边和对比度,让字符更容易被检测。预处理改变的是像素,不判断某串数字是否为账号。
- OCR检测文字区域并识别字符,回答“页面上写了什么”。“0/O”“1/l”“未/末”、简繁异体字和小数点都是常见混淆。
- 版面与表格分析恢复标题、段落、多栏阅读顺序、行列、合并单元格以及键值关系,回答“文字之间是什么结构”。字符全对,行列错位,银行流水仍然不可用。
- 字段抽取与实体识别从文字和结构中定位合同编号、姓名、地址、账号、金额等对象。固定格式字段适合规则校验;姓名、机构、地址等依赖上下文的内容更需要实体识别和人工判断。
- 脱敏与验证按接收对象和用途处理敏感内容,导出后重新打开结果,反查是否仍能搜索、复制或看到原值。OCR 的置信度不是脱敏完成证明。
不能把“整页文字识别率较高”等同于“关键字段没有漏检”。若银行卡号中的一位错成字母,字段抽取与脱敏仍可能失效。业务验收必须把字符、结构、字段和最终页面分层统计。
一条可审计的 OCR—复核—脱敏管道
建议把流程固化为以下十个控制点。每一步都应保留输入版本、输出版本、异常原因和经办人,避免在最终发现漏项时无法判断问题发生在哪一层。
| 阶段 | 核心动作 | 需要留下的证据 | 不满足时的处理 |
|---|---|---|---|
| 1. 输入质量评估 | 判断有无文本层、页数、方向、分辨率、压缩、缺页和重复页 | 原件只读副本、文件哈希、页面清单、质量标签 | 缺页、来源不明或文件损坏时停止 |
| 2. 图像预处理 | 去歪斜、旋转、裁边、去噪、阴影修正,必要时保留彩色版本 | 预处理参数与处理前后样张 | 不可逆增强掩盖印章或浅色字时回退 |
| 3. OCR | 识别简繁中文、中英混排、数字、标点并返回位置 | 原始识别结果、坐标、置信度或异常标记 | 无输出、乱码页进入异常队列 |
| 4. 版面/表格抽取 | 恢复多栏顺序、段落、表格行列和合并单元格 | 带坐标文本、结构化表格、页码映射 | 结构无法可靠恢复时降级为逐页人工录入 |
| 5. 字段/实体识别 | 用规则、校验位、词典与 NER 标记敏感候选 | 字段类型、原页位置、命中方式 | 冲突字段或不合语境的结果转人工 |
| 6. 低置信度队列 | 汇总低置信字符、重叠区域、缺失字段和规则冲突 | 异常类型、风险等级、负责人 | 高风险字段未清空不得进入外发 |
| 7. 人工校正 | 对照原图修字、修表、补字段;关键项双人复核 | 校正记录、复核人、变更前后值 | 原图也无法辨认时向文件提供方补件 |
| 8. 脱敏 | 按用途选择涂黑、星号、代指或人工图片框选 | 脱敏清单、规则版本、人工补标记录 | 接收对象或字段口径不明时暂停 |
| 9. 导出 | 生成与原件分离的结果副本,保留页序和必要语义 | 导出文件、版本号、生成时间 | 页数、版式或可读性异常时回到对应阶段 |
| 10. 反向验证 | 搜索、复制、缩放、抽图、逐页对照,检查漏项与误伤 | 验收记录、抽样清单、问题闭环 | 发现关键字段残留即阻断外发或上传 |
预处理不宜“一键拉满”。强二值化可能抹掉浅色印章、铅笔批注或防伪底纹,过度去噪会吞掉小数点和汉字细笔画。应保存原始页、标准处理页和特殊增强页,不能覆盖原件。
六类中文文档,关键字段和失败方式各不相同
1. 中文合同:正文准确还不够,还要管附件和印章
合同的关键字段通常包括当事人姓名或企业名称、统一社会信用代码、法定代表人、地址、联系方式、银行账号、合同编号、金额、日期,以及签名和印章图像。常见失败包括多栏附件阅读顺序颠倒、表格中的付款账号串列、骑缝章覆盖文字、扫描裁边切掉页码,以及手写补充条款未被识别。
应核对首页主体、尾页签署区、附件和骑缝区域;对账号、身份证号、金额和联系人执行双人复核。签名、指纹、印章可能需要人工框选,不能假定 OCR 一定发现。
2. 银行流水:字符正确,还要保证行列和借贷方向
流水的关键字段包括户名、账号或卡号、交易日期时间、对方户名与账号、摘要、币种、收入、支出、余额和流水号。表格识别若把下一行金额并到上一行,或者把“收入”和“支出”列对调,单个字符看似都对,财务语义却已损坏。
应按单元格核对行列,对日期、金额、余额做格式与勾稽检查;若仍需趋势分析,先定义数值保留或变换方式,并复核负数、小数和币种。不能用“能导出 Excel”代替结构验收。
3. 发票:号码、代码、金额和校验码容错空间很小
发票通常关注购买方与销售方名称、统一社会信用代码、地址电话、开户行及账号、发票号码、开票日期、项目明细、金额、税额、价税合计和备注。二维码、底纹、印章与细小字体可能互相干扰,“8/B”“0/O”、小数点遗漏和大写金额错字会让字段校验失败。
样本应覆盖打印件、复印件、折痕、印章压字和低对比度页面。抽取后校验号码长度、日期、金额合计和购销双方位置;失败页面进入复核队列,不能自动猜测。
4. 营业执照:复杂背景和版式变化会影响字段定位
营业执照的关键字段包括名称、类型、法定代表人、经营范围、注册资本、成立日期、住所、统一社会信用代码和登记机关。国徽、底纹、二维码、悬挂拍照产生的透视变形,以及不同年份版式,都会影响字段和值的配对。
这类证照要结合版面位置、字段标签和代码格式交叉验证,避免把背景或附件号码当成目标值;经营范围长文本还应检查断行、漏行和阅读顺序。
5. 病历:手写、专业缩写与时间线需要临床复核
病历可能包含患者姓名、证件号、住址、联系方式、就诊号、住院号、科室、诊断、检查结果、处方、医师签名和时间。医生手写、医学缩写、上下标、单位和阴阳性符号对通用 OCR 都很困难,字符错误还可能改变医学含义。
OCR 索引不能替代原始病历。用于脱敏外发时,应核对身份字段、页间患者标识、检查单粘贴区和签名。临床内容无法确认时保留原图定位并升级处理,不能让语言模型“补全”。
6. 政务档案:旧纸张、繁体字和多层批注是常态
政务档案常见关键字段包括姓名、证件信息、家庭住址、联系电话、单位、文号、案号、档号、日期、签批意见、印章和附件目录。老旧复印件可能有繁体字、竖排、铅笔批注、透印、纸张泛黄、装订阴影和缺角,多份材料还会混合不同年代的字体与表格。
应先确认档案用途,再定义隐藏内容。版面无法恢复时,可保留页面级图像索引并人工著录。不能为“可搜索”破坏档案原貌;原件、处理副本与发布副本应分开管理。
测试矩阵:不要只拿干净样张做演示
试点测试集应来自获授权的真实分布,并去除与目标无关的重复样本。每个维度至少覆盖正常、轻度困难和严重困难三档;高风险但低频的材料应主动补样,不能被海量清晰页稀释。
| 测试维度 | 必测样本 | 重点观察 |
|---|---|---|
| 文字体系 | 简体、繁体、简繁混排、异体或旧字形 | 字符混淆、词语被自动改写、繁体字段漏检 |
| 语言混排 | 中文与英文公司名、邮箱、缩写、大小写 | 分词、空格、大小写和阅读顺序 |
| 数字符号 | 身份证号、账号、金额、日期、百分号、小数点 | 0/O、1/l、千分位、小数点、负号 |
| 非印刷内容 | 印章、签名、手写批注、指纹 | 是否被漏掉、误作正文或覆盖邻近文字 |
| 图像质量 | 倾斜、模糊、阴影、反光、低 DPI、压缩噪声 | 字符与标点损失、坐标漂移、整页失败 |
| 版面结构 | 多栏、竖排、页眉页脚、脚注、附件 | 阅读顺序、跨栏合并、页码误入正文 |
| 表格 | 有线、无线、合并单元格、跨页表格 | 单元格归属、行列错位、跨页续表 |
| 遮挡叠加 | 盖章压字、签字压线、折痕、装订黑边 | 被遮字符、印章与正文边界、裁边误删 |
| 复杂背景 | 证照底纹、发票底纹、水印、污渍、照片背景 | 背景误识别、浅色字消失、区域漏检 |
每个样本都要保存目标字符、单元格、关键字段和敏感实体的正确值及坐标。金标准由两名标注者处理争议;原图无法判定的内容标为“不可判读”,不强行参与计算。
六组指标如何计算,为什么不能设万能阈值
不同文档、字段风险和下游用途决定不同验收线。用于全文搜索的档案可以容忍少量非关键字符错误;用于脱敏外发的身份证号、账号和患者身份字段则几乎不能容忍漏检。以下指标需要同时看,不能只挑表现最好的一项。
字符错误率(CER)
CER =(替换字符数 + 删除字符数 + 插入字符数)÷ 金标准字符总数
例如金标准有 10,000 个字符,识别结果相对它出现 60 次替换、20 次删除、20 次插入,则 CER 为 (60 + 20 + 20) ÷ 10,000 = 1%。应按简体、繁体、数字、手写和印章覆盖区分层报告,避免平均值掩盖难例。
字段级精确率与召回率
字段精确率 = 正确提取字段数 ÷ 系统提取字段总数
字段召回率 = 正确提取字段数 ÷ 金标准应有字段总数
若样本应有 120 个账号,系统提取 110 个,其中 100 个值和位置均正确,则精确率为 100 ÷ 110 ≈ 90.9%,召回率为 100 ÷ 120 ≈ 83.3%。精确率低意味着复核负担大,召回率低意味着漏项风险高;二者必须并列。
表格单元格准确率
表格单元格准确率 = 文字内容与行列归属均正确的单元格数 ÷ 金标准单元格总数
例如 500 个单元格中,470 个文字正确,但其中 15 个被放错行列,则真正正确的是 455 个,单元格准确率为 455 ÷ 500 = 91%。仅比较导出文本而忽略行列位置,会高估表格可用性。
页面成功率
先为项目定义“成功页”:例如无整页漏识别、阅读顺序可用、所有关键字段已进入候选或人工队列,且版面可供复核。页面成功率 = 成功页数 ÷ 处理总页数。若 300 页中 276 页满足定义,则为 92%。这个数字只在成功页定义一致时可比较。
人工复核率
人工复核率 = 进入人工检查的页数(或字段数)÷ 全部页数(或字段数)
例如 200 页中 70 页因低置信、复杂版面或高风险字段进入复核,页面口径复核率为 35%。报告必须注明按页还是按字段;复核率不是越低越好,异常规则过松也会制造虚假的低复核率。
关键字段漏检率
关键字段漏检率 = 未被 OCR、字段识别或人工队列发现的关键字段数 ÷ 金标准关键字段总数
若 80 个高风险字段中有 2 个直到终验才被发现,漏检率为 2 ÷ 80 = 2.5%。应同时列出漏掉的字段类型、页面质量和发生阶段。一个平均值不能抵消单个严重漏项。
企业应根据外发风险、人工能力和文件类型分别定线,并保留基线版本。更换扫描设备、OCR 模型、预处理参数、字段规则或文档来源后,都要重新评估,不能沿用旧结论。
低置信度与异常队列怎么设计
置信度只是排序信号,不是真实概率。队列不应只收“模型分数低”的字符,还应收这些异常:整页无文本、识别字符骤减、页码断裂、表格列数变化、校验位失败、金额勾稽不平、必填字段缺失、印章或签名区域与正文重叠、同一实体前后值冲突,以及预处理前后差异过大。
队列可分三类:普通纠错单人复核;账号、身份证号、患者标识、合同主体等高风险字段两人独立复核;无法判读、缺页、结构错乱或数据边界不明的任务升级。第二人应独立判断,再处理分歧。
所有关键字段、异常页和人工修改页应重点检查;普通页按文档类型、来源批次和设备分层抽取。若发现关键漏检、批次页序错乱、版本混用、未批准外发原件,或无法证明导出副本完成内容处理,应立即停止并回滚。
扫描合同处理后再交给豆包:两个数据边界,不能混为一个
假设企业法务收到一份 86 页扫描合同,需要让豆包帮助归纳履约义务。建议流程如下:先把原件置为只读,在受控本机完成页面清点、去歪斜和 OCR;核对主体、合同编号、账号、金额、联系人以及签署页;再用脱敏卫士(RedactOS)桌面端导入扫描型 PDF 或图片,结合固定格式规则与 AI/NER 标记姓名、地址、机构、身份证号、手机号、银行卡号、统一社会信用代码、合同编号和金额等候选项。
复核者关闭误报、划词补充漏项,对签名、印章等区域人工框选。后续 AI 需要理解关系时,可选“<人物1>”“<单位1>”等代指;公开展示可选涂黑或星号。高风险字段经第二人核对后,导出副本并搜索原值、尝试复制、放大签署区及检查页数。
只有验收通过的脱敏副本才进入后续步骤。把这份副本上传豆包时,数据已经离开前述本地处理边界,进入豆包及相关网络、账号、日志、历史记录和留存设置所决定的外部数据流。企业仍需按实际账号与使用方式核查服务条款、上传权限、可发送字段和留存策略。这里没有“豆包原生集成”的含义,也不能把“本地完成脱敏”解释为“后续 AI 处理仍在本地”。原件、脱敏映射表和可还原任务信息不得随脱敏副本一并上传。
脱敏卫士在这条流程中的位置与边界
桌面端支持 .docx、.txt、文字型 PDF、扫描型 PDF 和图片,可在本机完成导入、识别、复核与导出。固定格式字段可使用正则规则,姓名、地址、单位和机构等语义实体可由 AI/NER 标记;用户可查看脱敏项目清单,取消误报,通过划词或图片框选补充遗漏,再按用途导出结果。所有任务会形成记录,便于后续复核和任务内还原。
这是“自动识别 + 人工复核”的本地工作台,不保证所有 OCR 场景完美识别。模糊手写、重叠印章、复杂表单和多栏顺序仍可能需要专门 OCR、人工校正或补件。脱敏卫士不应被描述为已有通用云 API、云协作或豆包原生连接器;Skill 或 CLI 之后的模型数据流仍取决于实际配置。
国内 OCR 候选如何做非排名 POC
需要专门版面、表格或字段能力时,可以从官方中文资料建立候选清单,但不要把不同数据集、接口和口径下的厂商准确率放在一张排行榜里。以下信息仅用于确定试点范围,不能替代本组织样本测试。
| 非排名候选 | 官方资料可确认的窄能力 | 在试点中的用法 |
|---|---|---|
| 百度智能云 OCR | 官方接口简介列出含位置通用文字、办公文档版面、手写、表格、印章和结构化能力 | 分别测试合同版面、印章覆盖区和表格;不引用官网宣传准确率 |
| 腾讯云表格识别 V3 | 官方接口说明支持中英文图片/PDF中的常规、无线和多表格,返回单元格内容,并说明 PDF 按页处理 | 用银行流水和跨页表格样本验证行列、旋转页与单页调用限制 |
| 阿里云 OCR 表格识别 | 官方接口说明列出有线、条纹、无线及手写表格、低置信度提示;该接口支持多种图片格式但不直接支持 PDF | 用发票和表单图片测试低置信队列,PDF 先确认另行解析路径 |
候选入口分别见百度智能云 OCR 接口简介、腾讯云表格识别 V3和阿里云表格识别接口。云端接口通常意味着文件或图像需要按接口数据流提交;测试前应单独确认账号权限、区域、日志、存储、删除和合同要求。若材料不允许离开本机或专网,就不能仅因识别能力合适而直接上传。
一个可落地的四阶段试点
阶段一:定义用途与金标准
选定一个边界清楚的流程,例如“扫描合同外发前脱敏”,不要一次覆盖所有部门。由业务、安全、档案与执行人员共同定义关键字段、允许输出形式、停止条件和指标口径。按六类文档与测试矩阵抽取获授权样本,建立双人标注的金标准,并冻结原件。
阶段二:小样本跑通全链路
用少量但难度分层的文件跑完输入评估、预处理、OCR、结构抽取、实体识别、异常队列、人工复核、脱敏、导出和反向验证。记录每次人工修改及原因。此阶段目标是发现队列和责任断点,不是追求漂亮平均数。
阶段三:扩大批次并做对照
扩大到不同来源、设备、月份和文档版式,使用同一金标准口径比较不同配置。分别报告 CER、字段精确率与召回率、单元格准确率、页面成功率、人工复核率和关键字段漏检率。对云端候选还要记录实际数据流和失败重试,不只看识别输出。
阶段四:验收、上线与持续监测
按文件类型设定自己的验收线,明确哪些页面全检、哪些分层抽检、谁能放行。上线后按批次监测难例比例、人工复核量和漏项原因。扫描仪、模型、规则或版式发生变化时触发回归测试;指标持续恶化或关键漏检出现时暂停自动放行。
上线前验收清单
- [ ] 原件只读保存,页数、顺序、重复页和文件哈希已有记录。
- [ ] 预处理参数可追溯,特殊增强没有覆盖唯一原图。
- [ ] 简繁、中英、数字、手写、印章和签名难例均进入测试集。
- [ ] 倾斜、模糊、阴影、低 DPI、多栏、表格、盖章压字和复杂背景均有结果。
- [ ] 六项指标按统一金标准计算,并按文档与风险字段分层报告。
- [ ] 低置信、字段缺失、校验失败、结构冲突和整页异常均能进入队列。
- [ ] 身份证号、账号、患者标识、合同主体等关键字段已按要求双人复核。
- [ ] 脱敏规则、人工修改、导出版本、复核人和放行时间可以追溯。
- [ ] 导出副本已在独立阅读环境中完成搜索、复制、缩放和逐页反查。
- [ ] 原件、脱敏副本、任务记录与映射表按不同敏感级别控制访问。
- [ ] 若结果交给豆包或其他外部 AI,已另行批准发送范围并核查数据流。
- [ ] 已定义停机、补件、人工降级和升级责任人。
常见故障排查
| 现象 | 可能原因 | 排查与处置 |
|---|---|---|
| 某页完全没有文字 | 页面被识别为空白、方向异常、加密或渲染失败 | 对照原页检查方向和渲染,单页重试;仍失败则进入人工队列 |
| 字符清楚但字段没命中 | OCR 分词、字符混淆、规则缺少引导词或实体上下文不足 | 查看原始文字与坐标,修正字符;补自定义规则或人工标记 |
| 多栏正文顺序混乱 | 版面分区失败,页眉页脚被并入正文 | 调整版面模型或区域;高风险页保留原图逐区复核 |
| 表格金额串行串列 | 线框断裂、合并单元格、旋转或跨页续表 | 用单元格金标准核对,检查旋转角;必要时人工重建结构 |
| 印章下文字消失 | 红章与黑字重叠、灰度化或二值化过强 | 回到彩色原图,采用分色或较弱增强;人工确认被遮内容 |
| 手写内容被自动“润色” | 后处理语言模型按语境猜测 | 保留原始 OCR 输出,关闭不必要自动纠错;不可判读项不补写 |
| 导出后仍能复制原值 | 只加了视觉覆盖层,原文本或图像仍在 | 立即阻断外发,回到正式内容处理并重新做反向验证 |
| 人工队列突然减少 | 阈值、规则、版本或样本来源发生变化 | 比较版本与难例分布,抽检未入队页面,排除异常规则过松 |
FAQ
1. 扫描分辨率达到某个数值,就一定能识别好吗?
不能。分辨率只是一个因素,焦点、压缩、倾斜、阴影、纸张、字体、印章遮挡和单字像素大小都会影响结果。应以真实样本的分层测试为准,并保存原图,不要为追求锐度过度处理。
2. OCR 置信度很高,是否可以跳过人工复核?
不建议。置信度用于排序,不等于业务正确性。格式合法但属于错误对象的账号,可能仍获较高分。高风险字段、异常页和所有人工修改页应按既定标准复核。
3. 手写、签名和印章能否全部自动识别并脱敏?
不能作这种承诺。部分专门能力可以识别某些手写或印章,但材料质量和样式差异很大;签名、指纹、印章及其覆盖文字经常需要人工框选、双人核对或补件。
4. OCR 后已经搜不到姓名,是否说明脱敏完成?
不是。姓名可能仍存在于页面图像、隐藏文本、附件或其他拼写形式中;账号、地址、签名和印章也未必能用姓名搜索发现。应对导出文件执行搜索、复制、缩放、逐页对照和图片区域检查。
5. 本地完成 OCR 和脱敏后,能否直接把结果上传豆包?
仍需审批和核查。先确认关键字段漏检率、导出验证和接收用途,再确认豆包实际使用方式下的发送、权限、日志、历史记录与留存。上传行为是新的外部数据流,本地步骤不会自动把后续处理变成本地。
6. 应该选择本地 OCR 还是云端 OCR?
先看数据边界,再看样本效果。禁止外联或高保密材料应优先满足本机、专网或获批部署要求;允许云端处理时,也要核查接口数据流并用同一测试集做 POC。能力名称、价格或厂商宣传不能替代本组织验收。
结语:真正的目标是可验证,而不是“识别完成”
AI OCR 可以把难以搜索的中文扫描件转成可处理内容,但它不会自动消除图像质量、版面、表格、字段语义和数据流风险。可靠的做法是把每一层的输入输出拆开,把低置信和业务异常送入人工队列,用六组指标持续测量,再用导出后的反向验证决定文件能否外发。
对于合同、流水、发票、营业执照、病历和政务档案,最重要的不是追求一个脱离样本的“高准确率”,而是知道哪些字段不能漏、哪些页面必须停、谁来复核、结果将流向哪里。做到这一点,OCR 才真正成为可审计的文档处理入口,而不是把像素错误带进脱敏和外部 AI 的放大器。
下一步: 可先查看脱敏卫士对扫描件、OCR 内容和图片框选的支持,再使用虚构或已授权的非敏感扫描样本在线体验。真实高敏材料应在桌面端本机处理并执行第二人复核。
相关阅读
参考来源
- | 百度智能云 OCR 接口简介 | | 官方接口表列出含位置通用文字、办公文档版面、手写、表格、印章和智能结构化能力;能力是不同接口,不推导为单一接口全部覆盖 | 说明合同版面、印章与表格可分别列入候选测试,不引用宣传准确率 |
- | 腾讯云表格识别 V3 | | 官方接口说明支持中英文图片/PDF内常规、无线和多表格,返回单元格内容;接口参数说明 PDF 按指定页处理 | 用于银行流水、多表格、旋转页和 PDF 分页试点范围,不与其他厂商做准确率排名 |
- | 阿里云 OCR 表格识别 | | 官方接口说明支持有线、条纹、无线及手写表格,提供低置信度提示;支持多种图片格式,该接口不直接支持 PDF | 用于低置信队列和发票/表单图片 POC,并提醒 PDF 需另核解析路径 |
- | 阿里云 OCR 文件格式说明 | | 官方说明列出通用文字、表格、手写和文档结构化等接口的图片类型与部分 PDF/OFD 限制 | 用于确认正式 POC 前须按具体接口逐项核对格式和页数,而非按产品总称推断 |
- | 豆包隐私政策 | | “智能对话”部分说明用户可向对话框发送文字、语音、图片、文件等内容,豆包收集这些信息以提供对话服务;同一政策还分别说明账号登录、记忆管理、操作/使用/服务日志,以及豆包个人版“帮助模型改进效果”设置。具体处理仍随实际版本、账号和设置而异 | 仅支撑“上传文件已进入外部服务数据流,上传前须核查账号、历史/记忆、日志、模型改进及留存相关政策和设置”;不把本地脱敏边界外推到豆包 |
- | 豆包用户协议 | | 协议说明用户可提交输入;在适用法律范围内,输入知识产权归用户或相应权利人;对 AI 云盘上传、存储、分享内容,用户须确保不违法、不侵权并承担相应责任。隐私政策另要求输入含他人个人信息时先取得合法授权 | 支撑上传者应确认对合同及其中他人信息具有相应权利或授权,并遵守组织权限;不扩展为对合同上传合法性的个案结论 |