PDFIntact

从 PDF 中原样取出表格与正文

这份 PDF 复制出来是乱码

选中 PDF 里的文字,复制、粘贴,得到的却是另一套文字系统的一串乱码。屏幕上明明显示正常,只有复制的那一刻才出问题。

成因是文件内嵌的字体缺少把字形对应到字符编码的表 —— ToUnicode CMap。显示只需要「画出这个形状」,所以没有它页面照样正确。复制需要字符编码,链条正是在这里断掉的。这在期刊论文、政府文件和用旧排版软件生成的文件中很常见。

文字并没有损坏。页面上画着可读的字形,所以把页面当作图像重新读取就能取回正文。换字体或换个程序粘贴都没有用 —— 信息在复制的那一刻就已经丢了。

现在就试

用您自己的 PDF 确认

检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。

实例

実際のPDFからコピーした文字列

下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。

コピーした結果

ᆅ᪉බඹᅋయ࡟࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋ࡟ࡘ࠸࡚

PDFIntact で取り出した結果

地方公共団体における書面規制、押印、対面規制の見直しについて

お手元の文字列で判定する

コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。

判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。

常见问题

为什么从 PDF 复制出来是乱码?
因为文件内嵌的字体缺少标明每个字形对应哪个字符的对照表(ToUnicode CMap)。页面显示正常,但复制会得到另一批字符。文字并没有损坏,只是缺了对照表,所以把页面当作图像读取就能取回。
乱码的 PDF 还能取出正文吗?
可以。PDFIntact 把页面当作图像重新读取,用文字识别还原正文。检测在付款前完全在您的浏览器内运行,因此可以先用自己的文件确认。不会上传任何内容。
粘贴到 Word 里会不会好?
不会。字符编码在复制的那一刻就已经丢失,因此粘到哪里都是同样的乱码。换字体也没有用。
价格是多少?
按页数一次性收费:1–10 页 160 日元,11–30 页 300 日元,31–60 页 550 日元,61–100 页 850 日元,101–200 页 1,500 日元。无需注册,检测本身免费。

把其他症状也一并检测各导出格式的差异