这份 PDF 复制出来是乱码
选中 PDF 里的文字,复制、粘贴,得到的却是另一套文字系统的一串乱码。屏幕上明明显示正常,只有复制的那一刻才出问题。
成因是文件内嵌的字体缺少把字形对应到字符编码的表 —— ToUnicode CMap。显示只需要「画出这个形状」,所以没有它页面照样正确。复制需要字符编码,链条正是在这里断掉的。这在期刊论文、政府文件和用旧排版软件生成的文件中很常见。
文字并没有损坏。页面上画着可读的字形,所以把页面当作图像重新读取就能取回正文。换字体或换个程序粘贴都没有用 —— 信息在复制的那一刻就已经丢了。
现在就试
用您自己的 PDF 确认
检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。
实例
実際のPDFからコピーした文字列
下は官公庁の資料からコピーした実物です。左が化けたもの、右が復元したものです。左をコピーして、お使いのエディタに貼ってみてください。同じ結果になります。
コピーした結果
ᆅ᪉බඹᅋయ࠾ࡅࡿ᭩㠃つไࠊᢲ༳ࠊᑐ㠃つไࡢぢ┤ࡋࡘ࠸࡚
PDFIntact で取り出した結果
地方公共団体における書面規制、押印、対面規制の見直しについて
お手元の文字列で判定する
コピーした文字列を貼ると、それがこの種類の文字化けかどうかをその場で判定します。PDFを用意しなくても、コピーした結果だけで確かめられます。
判定はこのブラウザの中だけで行っています。入力した文字列はどこにも送信されません。
常见问题
- 为什么从 PDF 复制出来是乱码?
- 因为文件内嵌的字体缺少标明每个字形对应哪个字符的对照表(ToUnicode CMap)。页面显示正常,但复制会得到另一批字符。文字并没有损坏,只是缺了对照表,所以把页面当作图像读取就能取回。
- 乱码的 PDF 还能取出正文吗?
- 可以。PDFIntact 把页面当作图像重新读取,用文字识别还原正文。检测在付款前完全在您的浏览器内运行,因此可以先用自己的文件确认。不会上传任何内容。
- 粘贴到 Word 里会不会好?
- 不会。字符编码在复制的那一刻就已经丢失,因此粘到哪里都是同样的乱码。换字体也没有用。
- 价格是多少?
- 按页数一次性收费:1–10 页 160 日元,11–30 页 300 日元,31–60 页 550 日元,61–100 页 850 日元,101–200 页 1,500 日元。无需注册,检测本身免费。