PDFIntact

从 PDF 中原样取出表格与正文

扫描版 PDF 无法选中或复制文字

在复印机扫来的文件里想选中文字,却什么也选不到。搜索也搜不出来。一拖动,选中的是一个矩形而不是词语。

原因是这个文件只是纸张的图像。扫描仪保存的是页面看起来的样子。在您眼里是文字,在文件内部与一张照片没有区别。里面根本没有字符数据,因此没有东西可选、可复制、可搜索。

要取出来,就必须从图像中把字读出来。印刷发虚、页面倾斜、分辨率过低,都会造成读不出来的段落。PDFIntact 会把这些标为无法读取,而不是留白 —— 悄悄填上才是让错误无法被察觉的做法。

现在就试

用您自己的 PDF 确认

检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。

实例

まず見分けてください

同じ「PDF」でも、原因によって対処が変わります。次のどれに当てはまるかで判断できます。

文字を選択できない・検索しても出てこない
スキャンPDF(画像)です。このページの対象です。
選択もコピーもできるが、貼り付けると読めない文字になる
画像ではなく、フォントの対応表が欠けている状態です。PDFをコピーすると文字化けする をご覧ください。
文字は取り出せるが、表の行と列がずれる
PDFが表の構造を持っていないためです。PDFの表をExcelに貼り付けるとずれる をご覧ください。

常见问题

扫描版 PDF 为什么无法复制文字?
因为 PDF 里装的是页面的照片,而不是字符数据。在您看来是文字,对文件来说是一张图像,因此没有可选中、可搜索的东西。
怎样才能让文字可以选中?
必须从图像中识别字符。PDFIntact 分析每一页,把正文、表格与图表导出为 Excel、Word、Markdown 或 JSON。付款前可以在浏览器里确认您的文件能否读取。
手写字能读吗?
全篇手写的文件不在范围内。请用于以印刷文字为主的文件。哪些内容无法转换,购买前的检测会先告诉您。
扫描件里的表格能提取吗?
可以,框线与合并单元格都会还原。印刷发虚、页面倾斜或分辨率过低会留下读不出来的段落;那些地方会报告为无法读取,而不是靠猜。
我发送的文件会怎样?
检测完全在您的浏览器内进行,原件不会上传。为转换而发送的 PDF 会在 24 小时内删除;按设计,付款完成之前不会有任何内容到达我们的服务器。

把其他症状也一并检测各导出格式的差异