PDFIntact

从 PDF 中原样取出表格与正文

PDF 无法正常提取文字时,判断应使用 OCR、文本层恢复还是版式结构重建

OCR 和 PDF 文本提取有什么区别?转换前先做 3 项检查

通过文字选择、复制粘贴和版式检查,判断 PDF 需要 OCR、修复现有文本层,还是重建表格与阅读顺序。

PDFIntact 编辑团队发布

PDF 文字提取失败不一定需要 OCR

PDF 中的文字无法正常提取时,立刻运行 OCR 并不总是正确选择。问题文件大致分为三种状态:

  1. 页面只有图片,没有文本数据。
  2. 文本数据存在,但屏幕上显示的字形与复制出的字符映射错误或缺失。
  3. 字符能够提取,但表格结构或双栏阅读顺序丢失。

第一种需要 OCR 从图片中识别字符。第二种可能要结合文字外观和已有信息重建文本。第三种主要是版式结构重建问题,而不是字符识别问题。选择方法前先完成以下三项检查。

检查一:能否选中文字

在 PDF 阅读器中打开文件,尝试拖动鼠标选中一个句子。

完全无法选中

整页可能是一张图片。这在扫描文件和以图片方式导出的 PDF 中很常见,适合使用 OCR。

不过,文件权限或阅读器本身也可能禁止选择。断定文件没有文本层前,先换一个常用 PDF 阅读器测试。

能选中文字形状的区域

PDF 中存在某种文本层。添加 OCR 前,先复制一小段查看结果。重复添加 OCR 层可能产生双重字符,让后续搜索和复制更困难。

检查二:复制一个句子后得到什么

把一小段内容粘贴到纯文本编辑器,并根据结果判断:

复制结果 可能的文件状态 下一步
句子正确 文本层可用 只需检查表格、分栏等结构
出现其他字符或乱码 显示字形未映射到正确字符 根据视觉外观重建文字
粘贴结果为空 文本层不完整或页面为图片 继续检查其他页面
单词顺序错误 存在分栏或对象顺序问题 重建阅读顺序
每个字都出现两遍 图片和 OCR 文本层可能重叠 提取前清理重复文字

不要用单个页面判断整份 PDF。应分别测试普通正文页、含表格的页面和靠近文件末尾的页面。同一文件可能混合扫描页和数字生成页。

检查三:字符正确,但结构是否已经损坏

正文复制正确,不代表提取结果可直接使用。表格可能全部进入同一列,双栏论文的左右内容可能交错,公式中的上下标、分数关系也可能消失。此时字符识别成功了,丢失的是结构信息。

对于表格

需要重建单元格边界、合并表头以及行列关系。增加一层 OCR 文字并不能恢复表格的单元格结构。

对于双栏页面

不要只按页面坐标排列全部字符,而要确定预期顺序,通常是先读完左栏,再读右栏。

对于公式

上标、下标、分数和根式应表示为数学结构,而不是一串扁平字符。

什么时候用 OCR,什么时候利用现有文本层

PDF 状态 OCR 现有文本层 结构重建
仅有扫描图片 必需 不存在 有表格或分栏时必需
复制后出现乱码 有时可用于视觉恢复 可提供位置线索 取决于版式
正文可正确复制 通常不需要 应优先利用 表格、分栏或公式需要
OCR 文字重复 不要再加一层 清理或合并重复内容 按需处理

文件标注“可搜索”或“已 OCR”,也不能保证文本层真正可用。文字选择、复制准确性、阅读顺序和表格结构仍需分别检查。

再次运行 OCR 前保留原文件

不要用新生成的文本层覆盖来源 PDF。分别保存原始 PDF、处理后的 PDF 和提取结果,方便前后对照。

在文件名中加入处理日期或版本号,并保留每份输出与来源文件的关联。提取结果将用于分析时,这一点尤其重要。

快速判断流程

  1. 文字能否被选中?
  2. 一个句子能否准确复制?
  3. 表格、分栏和公式结构是否完整?
  4. 不同页面的状态是否不同?
  5. 最终需要 Excel、Word、Markdown 还是 JSON?

这些问题可以把图像识别、文本层恢复和版式重建区分开,避免没有必要的 OCR。

PDFIntact 的免费检查在浏览器内完成,不上传原始文件。它会报告页数、文本层状态以及检测到的表格和图形数量,但不会展示提取文本的预览,也不会验证阅读顺序或表格结构。选择转换方法后,仍需独立核对输出结果。

无需上传即可检查

先查看这份 PDF 中可以提取哪些内容

免费检查在浏览器内运行,不会上传原始文件。

免费检查无法复制文字的 PDF