双栏 PDF 复制出来两栏交错
选中双栏排版的论文正文,复制,粘到 Word 里。于是左栏的一行后面接着右栏的一行,如此反复,两段互不相干的文字被编织在一起,连一句话到哪里结束都看不出来。
原因是PDF 根本不保存栏的结构。文件里装的只是「在这个坐标画这个字形」这样的指令,哪里是一栏的开头、哪里是另一栏的结尾,文件里没有任何记载。复制和文本提取是按绘制位置自上而下逐行读取的,所以处在同一高度的左右两栏就被一行一行轮流取走。
所以栏只能从版面重新读回来。PDFIntact 先在页面中找出正文、标题、表格、插图这些区块,按阅读顺序重新排好,再写入 Word、Markdown、JSON。分栏本身不会还原,得到的是按阅读顺序排列的单栏文档。
现在就试
用您自己的 PDF 确认
检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。
实例
行の拾われ方が変わります
左右に並んだ3行ずつの段が、どの順で並ぶかを示した図です。実際の文面ではなく、拾われる順序だけを表しています。
コピーしたとき(描かれた位置の順)
左の段 1行目 右の段 1行目 左の段 2行目 右の段 2行目 左の段 3行目 右の段 3行目
PDFIntact を通したとき(読み順)
左の段 1行目 左の段 2行目 左の段 3行目 右の段 1行目 右の段 2行目 右の段 3行目
形式ごとに、どう入るか
同じ読み順でも、書き出す形式によって入り方が違います。
Word(.docx)
読み順のまま、1段の段落として並びます。段組は再現しません。
Markdown(.md)
同じ範囲を、ページごとの見出しの下に読み順で置きます。
JSON
ブロックの種別・ページ番号・ページ内の座標つきで入るので、どの段のどこから来た文章かを後から辿れます。
Excel(.xlsx)
本文は入りません。Excelに書き出すのは表とグラフだけです。
脚注・キャプション・ページ番号
これらは本文とは別のブロックとして、読み順のその位置に段落で入ります。 2段組の論文では図のキャプションが本文と分けて取れること、 書籍のスキャンでは脚注の区切り線より下が別ブロックになりページ番号が本文に混ざらないことを、 それぞれ確認しています。Wordの脚注機能には入れません。段落として入ります。
常见问题
- 复制双栏 PDF 时为什么两栏会交错?
- 因为 PDF 并不把栏当作栏来保存。文件里只有「在这个坐标画这个字形」,没有任何标记说明一栏从哪里开始、另一栏到哪里结束。复制是自上而下逐行扫过页面的,所以处在同一高度的两栏就被一行一行轮流取走。
- 阅读顺序是怎么恢复的?
- 先在页面中找出正文、标题、表格、插图这些区块,再按阅读顺序重新排好,然后才写出。分栏本身不会还原:Word 和 Markdown 得到的是按阅读顺序排列的单栏文档。
- 脚注和图注会怎样?
- 它们会作为独立的区块,以段落的形式出现在阅读顺序中的相应位置。我们的验证中,图注与正文分开取出,脚注分隔线以下成为单独的区块,页码也没有混进正文。它们不会变成 Word 的脚注,而是以段落的形式进入。
- 正文可以导出成哪些格式?
- Word、Markdown 和 JSON。JSON 还带有区块类型、页码和页内坐标,因此可以追溯某段文字来自哪一栏、哪个位置。正文不会进入 Excel:导出到 Excel 的只有表格和图表。
- 阅读顺序对了,文字就一定读对了吗?
- 这是两回事。有的检样阅读顺序保住了,文字识别却崩了。所以每个区块都带有确度标示——读取、推测或无法读取。请务必把结果与原始 PDF 核对。