PDF 怎么提取文字?先分清文字层、扫描件与阅读顺序
PDF 转 TXT 前先判断有没有文字层。本文说明文字层与 OCR 的区别、双栏错序、特殊字体乱码、密码文件和多种导出格式的选择。
打开配套工具 →从 PDF 里复制文字,最容易误解的一点是:页面上看得到字,不代表文件里真的存了文字。扫描合同、复印件和拍照生成的 PDF,通常只有一张页面图片;从 Word、排版软件或浏览器导出的 PDF,才更可能包含可以选择、搜索和提取的文字层。
PDF 提取文字工具读取的是 PDF 已有文字层。它不会把空结果包装成“识别成功”,也不会在后台上传文件调用 OCR。开始处理前,先用鼠标在原 PDF 中拖选一段文字,是最简单也最有效的判断方法。
文字层提取和 OCR 不是一回事
文字层提取相当于读取 PDF 中已经存在的字符、坐标和换行提示。速度快,通常也不会把姓名和数字识别错。OCR 则要分析页面像素,推测图片里是什么字,适合扫描件,但会受到清晰度、语言、倾斜、表格线和印章影响。
如果鼠标能选中文字,优先使用文字层提取。若整页只能选中一张图片,或者搜索一个明确出现的词却没有结果,就应该走 OCR。可以先用 PDF 转 JPG / PNG 导出少量页面,检查扫描清晰度,再决定是否使用本地或可信的 OCR 软件。
不要把两种处理混在一起。原生 PDF 再做 OCR,可能把本来正确的文字重新识别出错;扫描件只做文字层提取,则会得到空白页。
为什么提取出来会错序
PDF 主要描述“把什么画在页面哪个位置”,不一定保存正常的段落结构。一个双栏页面可能先绘制左栏第一行,再绘制右栏第一行;表格可能按单元格逐块绘制;海报上的文字甚至按单字定位。
工具提供两种顺序:
- “按视觉行”根据纵向坐标组合同行文字,再按横向位置排列,适合表格、票据和布局明确的页面。
- “内容流”遵循 PDF 内部对象顺序与换行提示,适合由常规办公软件导出的文章。
这两种方式都不是万能的。双栏论文、页眉页脚、脚注、浮动文本框和复杂公式仍可能交错。比较稳的做法是先提取两三页,用两种模式分别查看,再处理整份文档。
乱码通常不是编码按钮能解决的
有些 PDF 使用自定义字体子集,页面绘制看起来正常,但字体没有提供可靠的字符映射。提取器拿到的可能是乱码、空字符或错误的标点。这不是简单切换 UTF-8、GBK 就能修复的问题,因为错误发生在 PDF 字形与 Unicode 字符之间的对应关系。
遇到这种情况,可以先在系统 PDF 阅读器里试着复制同一段。如果其他阅读器也乱码,说明源文件的文字映射本身就有问题。此时重新从原始 Word、InDesign 文件导出,通常比继续修补可靠;没有源文件时,只能把页面渲染成图片后再做 OCR。
页码范围和密码应该怎样处理
长文档不要一开始就提取全部。先填写 1-3 或 1,5,8-10,确认顺序、字符和空白页正常,再扩展范围。这样可以尽早发现某个章节使用了不同字体,也能减少浏览器一次占用的内存。
有“打开密码”的 PDF 可以在页面输入密码后重试。密码只交给当前浏览器中的 PDF 解析器,不会写进导出文件。证书加密、DRM、损坏文件或更严格的权限限制仍可能打不开,工具也不会移除安全限制。
TXT、Markdown、JSON 和逐页 ZIP 怎么选
TXT 适合全文搜索、复制到编辑器和一般归档。保留页码标题后,后续校对时可以快速回到原页。Markdown 会为每页生成标题和分隔线,适合继续整理成笔记或文章,但它不会自动识别原文真正的标题层级。
JSON 保存文件名、页码、每页文字、行列表和统计值,适合交给脚本、搜索索引或数据处理流程。逐页 TXT ZIP 则把每页单独保存,适合分工校对、逐页翻译或把问题页单独送去 OCR。
无论选哪一种格式,都不会保留原字体、图片、表格边框、链接和页面位置。需要保留视觉页面时,应同时保存原 PDF 或导出的页面图片。
一套可复核的处理流程
先保留原文件,用鼠标确认是否存在文字层。抽取前几页,分别试“按视觉行”和“内容流”。检查中文、数字、标点、双栏顺序和页眉页脚,再扩大页码范围。导出后搜索几个原文中的姓名、金额或编号,并逐页抽查。
如果只是多余空格和空行,可以继续使用 文本清理工具;需要核对篇幅时,可使用 字数统计工具。如果关键字段错序或乱码,不要只看总字符数判断成功,应回到原页确认文字层质量。
总结
PDF 转文字的关键不是点一次“转换”,而是先识别文件类型。原生文字层适合快速、准确地提取;扫描页面需要 OCR;特殊字体和复杂排版则必须抽样校对。先处理少量页面、选择合适的阅读顺序,再决定 TXT、Markdown、JSON 或逐页 ZIP,能避免把一份看似完整、实际错序的文本继续带入后续工作。