PDF 怎么正确脱敏?从类型诊断、字段识别到反向验收的完整指南
一份面向合同、流水、简历和医疗政务材料的 PDF 脱敏指南:先诊断、识别、复核并输出处理结果;需要 PDF 时再用批准的工具转制并完成双阅读器验收。
核心要点
- PDF 黑色矩形可能只改变显示层,不能代替内容脱敏和结构检查。
- 脱敏卫士可处理文字型、扫描型 PDF 和图片,并支持规则、AI/NER 与人工补标。
- 涂黑、星号和稳定代指应按收件人用途选择,不能只追求遮得更多。
- 最终副本还要检查元数据、批注、附件、表单、书签、链接和签名状态。
很多 PDF “打了码”仍然会泄露:页面上是黑块,鼠标却能选中下方文字;搜索姓名仍有命中;扫描页上的印章被挡住了,OCR 又读出了章内单位;正文处理完毕,附件、批注或文件属性里还留着原名称。问题不在黑色是否够黑,而在于是否把“页面看见的内容、可提取的内容和 PDF 容器里的其他对象”分别处理并验收。
本指南以当前桌面版脱敏卫士(RedactOS)为主流程。它支持文字型 PDF、扫描型 PDF 和图片的导入,可用正则规则与 AI/NER 生成敏感信息候选,允许人工取消误报、划词补标、框选图片区域,并按用途选择涂黑、星号遮盖或混淆代指。它不是通用 PDF 结构清理器,也不保证自动删除全部元数据、批注、附件、表单、书签、链接或数字签名对象。因此,一份可外发的结果必须经过两条链路:先在脱敏卫士里处理内容,再用独立 PDF 工具检查结构对象并反向验证。
先理解:视觉遮挡不等于内容脱敏
在普通 PDF 阅读器里画矩形、添加批注,往往只是新增一个覆盖层。原文字可能仍在下方文本层中,复制、搜索或文本提取就能读出;矩形也可能被移动、删除,或者在不同渲染器中出现错位。把字号改成白色、用图片盖住文字、截一张低清截图,同样不能替代正式处理:它们可能保留 OCR 层、裁切区外内容或原附件。
脱敏的目标也不是抽象地“删得越多越好”,而是围绕明确收件人与用途,生成一份最小必要披露的独立副本。对外公示合同可能要保留条款结构,却处理当事人身份、联系方式和签名印章;交给审计的流水可能要保留期间、币种与勾稽关系,却处理账户、交易对手和与审计目的无关的备注。处理方式取决于用途,验收标准则必须在操作前写清楚。
四类国内材料,分别要找什么
1. 合同、诉讼与法律材料
合同外发给外部顾问、制作培训案例或进入知识库前,通常要检查当事人姓名、身份证号、手机号、邮箱、住址、单位、统一社会信用代码、合同编号、司法案号、银行账户、金额、日期、网址,以及正文中的保密条款、价格条款、项目代号等商业信息。签名、手写批注、骑缝章与公章常以图片存在,不能只跑文本识别。附件中的授权书、证照和报价单也可能比正文更敏感。
例如,制作合同培训案例时可以保留“甲方、乙方、履约节点、违约责任”的逻辑,用稳定代指让同一主体在多份材料中保持一致;若对外公开,则可对无需展示的身份字段、签名与印章区域采用涂黑。数字签名或认证状态属于另一类 PDF 对象,修改前应先确认是否允许生成派生副本,不能把处理签名外观等同于移除或验证数字签名。
2. 银行流水、财务与审计材料
银行流水、审计底稿、发票附件和尽调资料常含户名、账号或银行卡号、开户机构、手机号、交易对手、摘要、金额、日期、发票代码、统一社会信用代码和内部项目号。表格里同一字段会跨页、跨列出现,页眉页脚还可能重复账户信息;一笔看似普通的金额,加上日期、机构和备注,也可能重新指向特定交易。
如果收件人只需验证趋势,可以选择稳定代指,并根据分析目的评估金额数值偏移;统一加减偏向保留差额,统一乘除偏向保留比例。若审计程序必须核对原始金额,就不应为了“看起来更安全”随意改数,而应依授权范围最小化其他字段。任何数值变换都要复核负数、小数、币种、单位、合计和比例,避免破坏财务语义。
3. 简历与人事材料
简历共享给用人部门、面试官或外部招聘服务时,常见字段包括姓名、手机号、邮箱、身份证号、住址、照片、生日、现单位、学校、社交主页、证书编号和紧急联系人。姓名被替换后,照片、邮箱前缀、个人主页链接或“某年某校某奖项”的组合仍可能完成再识别,因此要从“单字段清单”升级为“上下文组合检查”。
匿名初筛可用稳定代指保留同一候选人在多页附件中的一致关系;只允许联系候选人的角色则可能需要保留手机号而处理其他信息。处理前应先建立“接收角色—任务目的—必须保留字段”矩阵,不要把所有简历都套用同一套删除范围。
4. 医疗、政务与招投标材料
病历、检查单、政务申报材料、营业执照与投标文件经常混合文字、扫描页、表格、证照图片、签名印章和附件。需要检查姓名、身份证号、手机号、地址、就诊号或业务编号、机构、日期、金额、统一社会信用代码、法人签名、医师签名、公章、项目名称和未公开技术条款。病例中“年龄、科室、罕见诊断、就诊日期”的组合,投标文件中“项目名、报价、人员履历”的组合,都可能比一个号码更容易锁定主体。
此类材料通常风险较高:逐页复核之外,还应由熟悉业务的人进行第二次复核;政务公开或招标披露范围应以有权部门确认的口径为准。脱敏工具帮助执行字段处理,不代替披露决定,也不自动形成合规结论。
第一步:保留原件,建立授权工作副本
先把原始 PDF 设为只读或放入受控目录,不在唯一原件上直接操作。为工作副本建立可追踪名称,例如 项目代号_材料类型_原始_20260802.pdf、项目代号_材料类型_脱敏待复核_v01.pdf、项目代号_材料类型_外发_已验收_v02.pdf。名称里不要继续写真实姓名、身份证号或案件敏感描述,否则文件名本身就成为泄露点。
同时记录来源、文件哈希或其他完整性标识、处理人、授权人、收件人、用途、字段范围和截止时间。只有在确有处理授权、允许生成派生副本时才继续。原件、工作副本、导出件和验收记录分目录保存;处理账户只获得完成任务所需的最小权限。
以下情况应暂停,而不是尝试“想办法打开”:
- 加密或权限受限: 不知道密码、没有所有者授权,或文件明确禁止当前操作时,向文件所有者索取已授权的可处理副本;本文不提供密码或访问控制绕过方法。
- 数字签名或认证签名: 任何改动都可能改变签名状态。保留已签原件,请签署方或所有者提供未签源件、授权副本,或明确允许的派生流程;不要把页面上的签名图像与数字签名状态混为一谈。
- 文件损坏: 页面缺失、对象报错、无法稳定打开或导出时,先向来源方索取完整文件或从受控源应用重新导出,避免在不完整内容上做“成功”判断。
- 格式不受支持: 当前桌面端已验证范围包括文字型 PDF、扫描型 PDF 和图片。遇到特殊 PDF 封装或导入失败,应从可信源应用生成新的受控 PDF,并重新检查页数、附件与签名状态,不能假设转换没有改变内容。
- 法律或业务限制不清: 涉密、司法封存、医疗授权、招投标保密或档案管理要求不明确时,先由资料负责人确认能否复制、脱敏与外发。
第二步:诊断 PDF 类型,而不是直接点“开始”
在受控环境中用阅读器做三个快速测试:能否选择一行文字、能否搜索一个明确存在的词、放大后文字边缘是字体轮廓还是像素。再查看页缩略图,判断是否所有页面结构一致。
| 类型 | 典型信号 | 主要风险 | 处理重点 |
|---|---|---|---|
| 文字型 PDF | 文字可选择、搜索命中稳定 | 可见文字处理后仍需防复制或提取;特殊字体可能错位 | 规则与 NER 候选、逐项复核、结果输出及转制后文本反查 |
| 扫描型 PDF | 页面像照片,无法直接选择文字 | OCR 漏字、低清、倾斜、手写内容、章印覆盖 | 检查识别结果,逐页看图,图片区域手动框选 |
| 混合型 PDF | 部分页可搜索,部分页只有图;或图像上叠有 OCR 层 | 只检查其中一层会遗漏,搜索结果与视觉位置可能不一致 | 文本候选与页面图像双轨复核,结果输出及转制后再做 OCR |
| 图片丰富型 PDF | 证照、头像、截图、图表、签名印章很多 | 敏感信息直接写在像素中,实体识别未必覆盖 | 逐图检查,按区域框选,并检查图注和相邻文本 |
“能搜索”不证明是纯文字型,“不能搜索”也不证明页面没有隐藏 OCR 层。有的 PDF 同时含扫描图和不可见文本,有的页面是文字、附件却是扫描件。诊断结论要按页记录,不能只看第一页。
第三步:建立字段策略与验收样本
先定义收件人真正需要什么,再把字段分成三类:必须处理、允许保留、需要人工判断。固定格式字段可优先启用正则规则,例如身份证号、手机号、邮箱、银行卡号或账号、统一社会信用代码、合同编号、司法案号、金额和日期;姓名、详细地址、单位或机构等依赖上下文的实体,可使用 AI/NER 生成候选。组织特有的项目号、客户简称、产品代号或特殊证照格式可用自定义规则或黑名单补充,必须保留的常用词可用白名单保护。
预制规则有格式和引导词条件,不等于任意数字都会命中。例如账号可能依赖“账号、账户号、银行账号”等上下文,统一社会信用代码也有字符结构要求。先用一组代表性页面试跑:包括正文、页眉页脚、表格、印章覆盖、低清扫描和附件首页。记录每类字段的漏报与误报,再决定是否扩展规则;不要一次启用所有类别后,仅凭黑块数量判断效果。
高风险字段应采用双人复核。第一人核对候选、逐页补标并记录异常;第二人拿到字段策略和外发副本,从收件人视角反查,而不是只重复看第一人的标记。涉及身份证号、账户、签名印章、未成年人信息、病历身份、未公开报价或关键合同条款时,不宜只做低比例抽查。
第四步:在桌面端导入并生成候选
进入脱敏卫士的“信息脱敏任务”,选择中文及适用规则,导入已授权的工作副本。桌面端支持文字型 PDF、扫描型 PDF 和图片;多文件可进入批量流程,但可稳定处理的规模取决于终端配置与可用资源,不能把“可批量导入”理解成任意规模都能一次完成。
按本次用途启用实体类型与规则:结构化号码交给正则生成可解释候选,姓名、地址、机构等交给 AI/NER 识别;再加载已审批的自定义规则、黑名单和白名单。系统记录的命中来源有助于复核者判断某项来自规则还是模型。这里的输出只是“待处理清单”,不是自动通过的最终结论。
对关联合同、成套案卷或多份简历,需要在多文件之间保留人物和机构关系时,可使用一致的混淆代指与映射。批量策略应先在小样本上校准,再分批运行并记录每批页数、文件数、异常与复核人,避免单次任务过大后难以定位失败页面。
第五步:同时复核文字、OCR 结果与页面图像
先在脱敏项目清单中处理候选。遇到误报,关闭不需要处理的项目,或将必须保留的词加入白名单;遇到漏报,划词补充,高频漏项再沉淀为自定义规则或黑名单。对扫描页、证照、头像、二维码旁文字、手写签名、印章、表格截图等像素内容,逐页检查并手动框选自定义区域。
复核时至少走完三遍:第一遍按脱敏列表逐项确认;第二遍按页面从左上到右下检查,特别看页眉、页脚、边缘、表格跨页处和空白背页;第三遍按“人物—联系方式—证件—账户—机构—编号—金额日期—签名印章—商业条款”类别反查。不要因为签名或印章视觉上明显,就推断工具能自动识别其法律属性;当前可靠做法是把需要隐藏的外观区域纳入人工框选,并在额外工具中检查数字签名状态。
第六步:单独检查 PDF 结构与隐藏对象
内容脱敏完成前,应建立一张对象清单。脱敏卫士有证据支持的是文字内容、扫描 PDF 与图片的处理、候选复核和图片区域框选;没有证据表明它会自动清除 PDF 中的所有结构对象。下表中的“额外检查”不是可选装饰,而是外发验收的一部分。
| 对象 | 在脱敏卫士中的处理口径 | 还要做什么 |
|---|---|---|
| 可见文字 | 规则/NER 生成候选,人工取消误报与补标,再按所选方式输出 | 搜索、选择、复制粘贴和文本提取反查 |
| OCR 文本层 | 扫描型 PDF 可进入处理流程,但识别仍受画质与版面影响 | 检查图像与识别结果是否一致;对输出结果及转制后的最终 PDF 用独立 OCR 反查 |
| 页面图片、头像、截图 | 逐页检查并手动框选自定义区域 | 放大查看边缘;对输出图片及转制后的最终 PDF 重新 OCR |
| 手写签名、印章外观 | 作为图片区域人工判断和框选 | 区分外观与数字签名对象;确认收件人是否需要保留章形或签署事实 |
| 批注、评论、图形标记 | 不保证自动清除 | 在源应用或专业 PDF 工具中列出、展开、删除或按用途保留,并重新保存检查 |
| 附件与嵌入文件 | 不保证自动清除 | 打开附件面板逐个盘点;必要时分别脱敏,或从转制后的最终 PDF 移除 |
| 表单字段 | 不保证自动清除字段值、默认值或脚本 | 在 PDF 工具中检查字段、提交动作和隐藏值;必要时从源应用生成无表单副本 |
| 书签与页面缩略图 | 不保证自动处理书签标题或隐藏页面线索 | 检查书签文字、目标页、全部页缩略图和异常空白页 |
| 链接与动作 | 不保证自动清除 URL、邮件地址或跳转动作 | 检查链接目标、悬停地址和页面动作,移除不需要的外部指向 |
| 文档属性与元数据 | 不保证自动清除作者、标题、主题、关键词或自定义属性 | 使用源应用或 PDF 工具检查并清理;保存后再次查看属性 |
| 数字签名、认证与证书 | 不负责判断签名有效性,也不能把签名图片处理等同于签名对象处理 | 保留原签文件,按签署流程取得授权副本;在 PDF 工具中查看签名状态 |
如果 PDF 工具显示还有隐藏图层、不可见对象、嵌入文件或脚本,也应按组织规则处理。任何外部清理或重新打印、重新导出都可能改变页面、字体、链接、表单或签名状态,所以完成结构处理后必须回到最终文件重新做整套内容验收。
第七步:选择输出方式,按实际形态保存结果
脱敏卫士提供涂黑、星号遮盖和混淆代指三种主要方式。涂黑适合外发或公开展示;星号适合在授权场景下保留部分前后字符,便于人工核对;混淆代指使用“<人物1>”“<单位1>”等稳定标记,适合保留角色与文档结构,供内部分析或在受控流程中交给 AI。选择“涂黑”是产品处理方式,不等于在其他编辑器里随手画普通矩形。
需要跨文件阅读时,稳定代指有助于保持同一人物、机构的对应关系;需要未来还原时,可使用任务记录关联的还原能力。所有任务都会形成记录,映射表是可读文本,也包含原文与代指的对应关系,敏感程度不低于原件。谁能查看历史任务、执行还原、导出映射表或删除任务,应由组织明确;映射表不得与脱敏结果一起无控制外发。
当前知识库明确的结果导出形态包括 Word、文本、复制结果、图片导出或涂色遮罩;批量任务还可统一导出供 AI 处理的 Markdown。知识库没有确认原生 PDF-to-PDF 导出,因此不能把“导入 PDF”写成“脱敏卫士直接导出最终 PDF”。
业务必须交付 PDF 时,把转制列为脱敏卫士之外的独立步骤:用组织批准的源应用或 PDF 工具,将已复核结果生成 PDF,并记录工具、版本与转换时间。转制会重构文本层、字体、图片或元数据,因此产物是新的待验收对象;用 PDF 工具处理结构对象后,重新执行下一步全部测试。产品任务记录可支持追踪,但保存周期、删除、权限、加密和审计仍按实际部署确认。
第八步:双阅读器反向验收
验收对象是经批准工具转制并完成结构处理的最终 PDF,不是产品预览或尚未转制的结果。在全新会话中用两款独立阅读器打开,检查页数、方向、字体、图片、表格、黑条、签名印章区域、书签和链接。显示不一致时暂停外发,定位字体、透明度、图层或转换问题。
接着从“已知答案”反向攻击最终文件:
- 搜索原姓名、身份证号末四位、手机号片段、合同号、机构简称和项目代号;同义词、空格或短横线变体也要查。
- 鼠标选择脱敏区域及其前后文字,复制到纯文本编辑器,确认没有带出原值。
- 用独立文本提取工具导出全文,比较是否仍含原字段;不要只看阅读器的“无搜索结果”。
- 对文字页和扫描页重新做 OCR,尤其检查黑条边缘、印章覆盖、倾斜表格和低清页面。
- 查看文档属性和自定义元数据,确认作者、标题、主题、关键词、文件名等没有泄露。
- 展开批注、附件、嵌入文件、表单、书签和链接面板,逐项核对预期数量与内容。
- 查看数字签名或认证状态并与既定派生流程比对;不要自行断言“签名仍有效”或“已自动移除”。
- 让第二位复核者依据字段策略检查高风险页面,并把通过项、发现项、返工版本和最终批准人写入验收记录。
双阅读器一致、搜索无敏感命中,只能证明已执行这些测试,不能据此推导出超出约定工具链和测试范围的恢复性结论。最终结论应写成“在约定范围和测试方法下通过验收”,同时保留工具版本、测试时间和例外项。
按材料与风险设置验收强度
| 材料 | 典型高风险内容 | 最低内容检查 | 结构检查 | 复核要求 |
|---|---|---|---|---|
| 普通内部合同副本 | 联系方式、合同号、非必要条款 | 全文规则/NER 候选复核,逐页检查 | 属性、批注、附件、链接 | 一人处理,一人抽查关键字段 |
| 外发法律或招投标材料 | 身份证号、账户、签名印章、报价、证照 | 全文逐页与类别反查 | 全部结构对象与签名状态 | 双人全量复核高风险字段 |
| 银行流水或审计底稿 | 账号、交易对手、金额、摘要、日期 | 表格跨页检查,核对合计与数值语义 | 附件、属性、嵌入表单 | 业务复核者参与,关键字段双审 |
| 简历或人事材料 | 身份证号、联系方式、照片、组合识别信息 | 按接收角色核对保留与处理范围 | 链接、附件、属性 | 外部共享时对身份字段双审 |
| 病历、政务或公开材料 | 病历身份、未成年人信息、证照、项目秘密 | 逐页全量检查,扫描页重新 OCR | 全部结构对象、隐藏页与附件 | 业务负责人确认披露范围并双审 |
“低风险”也不是免检。风险分级只决定复核深度、人员与证据要求,不取消结果输出后的检查;需要 PDF 时,更不能取消转制后针对最终 PDF 的搜索、复制和结构检查。
常见故障怎么排查
扫描太差、页面旋转或倾斜
先确认源扫描是否完整,再从来源方获取更清晰版本。若只能处理现件,可在受控工具中校正方向、去倾斜或提高可读性,保留转换前后版本并核对页数。低清页不要仅依赖候选列表,应放大逐页检查,并对输出图片及转制后的最终 PDF 重新 OCR;处理结果无法可靠辨认时应暂停外发。
罕见字体、表格或印章压住文字
罕见字体可能导致选择位置、替换宽度或结果布局异常;表格可能把一个字段拆成多个文本片段;印章与正文重叠会同时影响文字识别和图像判断。分别检查文本层与页面图像,对拆分字段逐段补标,对签名印章区域手动框选。需要 PDF 时,在转制后比较两款阅读器,核对列宽、换行、合计、页码和遮挡边界。
漏报、误报反复出现
先看命中来源和规则条件。误报可关闭对应项目,稳定保留词可加入白名单;漏报可划词补充,高频特例再进入自定义规则或黑名单。每次调整都用包含正例、反例、页眉页脚和表格的样本回归,避免修掉一个误报又放进新的漏报。
大批量处理卡顿或结果难以复核
批量能力不等于没有资源上限。先用小样本校准,再按文件类型、页数或风险拆批;每批记录输入清单、完成状态、异常页与输出版本。同一实体需要跨文件一致时,使用稳定代指并保护映射关系。若终端资源不足或任务失败,应缩小批次重跑,不把缺少输出的文件当作已处理。
结果输出或 PDF 转制失败
保留失败记录,不覆盖可打开版本。产品输出失败时检查目录权限、磁盘、文件名和源文件,再用单文件定位;PDF 转制失败时保留已复核结果,单独排查转换工具。转制成功仍要核对页数、字体、图片、表格和链接,并重做反向验收。
签名状态发生变化
先区分手写签名图片、普通电子签名外观与数字签名或认证签名。任何内容修改都可能影响后者。暂停外发,保留签署原件,交由文件所有者或签署流程负责人确认是使用未签源件、生成授权派生副本,还是完成审批后重签。脱敏卫士用于处理内容,不负责自动判断签名有效性。
外发前一分钟清单
- [ ] 已确认收件人、用途、授权和最小披露范围。
- [ ] 原件只读保存,工作副本和最终副本命名清楚且文件名不泄密。
- [ ] 已按页判断文字、扫描、混合或图片型,并记录异常页。
- [ ] 正则、NER、自定义规则、黑白名单与代表性样本已经校准。
- [ ] 误报已取消,漏报已补标,图片、签名和印章区域已人工检查。
- [ ] 批注、附件、嵌入文件、表单、书签、链接、属性和数字签名状态已用额外工具检查。
- [ ] 已按实际支持形态保存 Word、文本、复制、图片、涂色遮罩或批量 Markdown 结果;未暗示原生 PDF-to-PDF 导出。
- [ ] 如需 PDF,已用经批准的源应用/PDF 工具转制,且中间件、工具版本和转换时间有记录。
- [ ] 转制后的最终 PDF 在两款阅读器中渲染一致,搜索、复制、文本提取、重新 OCR 与结构对象检查均完成。
- [ ] 高风险字段已由第二人复核,验收记录写明工具版本、发现项与批准人。
- [ ] 临时扫描件、转换件和失败导出已按组织留存策略安全处置,不遗留在下载目录、共享盘或聊天窗口。
常见问题
1. 在 PDF 上画黑色矩形后,为什么搜索还能搜到原文?
因为普通矩形可能只是批注或覆盖层,底层文字对象没有被处理。应把该字段纳入正式脱敏流程,检查产品实际输出;如需 PDF,再用批准工具转制,并对最终 PDF 重新搜索、复制粘贴和提取文本。即使页面上看不到原文,也要检查 OCR 层、批注和附件。
2. 扫描 PDF 没有可选择文字,还需要检查文本层吗?
需要。有些扫描件带不可见 OCR 层,有些是纯图片,还有些页面混合两者。先按页诊断;在脱敏卫士中同时检查识别结果与页面图像,框选像素中的敏感区域;最终副本再用独立 OCR 反查。
3. 脱敏卫士会自动清除元数据、附件和批注吗?
当前产品证据不支持这样的承诺。应使用源应用或专业 PDF 工具单独检查文档属性、批注、附件、嵌入文件、表单、书签和链接,处理后再对最终文件重做内容与结构验收。
4. 签名和印章能不能直接框选处理?
需要隐藏的签名或印章外观可以作为图片区域人工检查和框选,但这不等于处理了数字签名对象,也不说明签名状态有效或无效。遇到已签名、已认证文件,应保留原件并按授权的派生、作废或重签流程办理。
5. 涂黑、星号和混淆代指怎么选?
公开或外发通常偏向涂黑;需要保留少量字符供授权人员核对时可用星号;需要保留人物、机构和上下文关系,供内部分析或后续受控还原时可用稳定代指。无论选择哪一种,结果输出前都要人工复核;如需最终 PDF,转制后还要执行全套反向验收。
6. 最终 PDF 搜索不到敏感词,是否就可以发送?
还不够。还要测试选择与复制、全文提取、独立 OCR、文档属性、批注、附件、表单、书签、链接、签名状态,并在第二款阅读器中检查渲染。高风险材料还需要第二位复核者确认;发送前只使用已经完成验收并批准的最终版本。
PDF 脱敏不是一个按钮,而是一套“授权副本—类型诊断—候选识别—人工复核—图片处理—实际形态输出—批准工具转制 PDF—结构清理—反向验收”的闭环。把脱敏卫士用于它已经验证的内容处理能力,把最终 PDF 的生成和结构对象检查交给适当的源应用或 PDF 工具,再用可复现的验收记录证明检查范围,才能让外发决定建立在证据上,而不是建立在黑条的视觉印象上。
下一步: 可以先查看脱敏卫士支持的文件类型、识别与复核能力,再使用虚构或已获授权的非敏感 PDF 在线体验。真实敏感材料应使用桌面端在本机处理,并按本文清单检查最终 PDF 结构。