将双栏论文 PDF 转换为 Word,避免左右两栏正文相互穿插
双栏论文 PDF 转 Word:如何保持正确的阅读顺序
解释双栏 PDF 复制后文字顺序错乱的原因,以及如何核对转入 Word 后的正文、标题、表格和公式顺序。
视觉排版不等于 PDF 内部的阅读顺序
阅读双栏论文时,人会自然地从左栏顶部读到底部,再转到右栏顶部。但 PDF 内部的字符不一定按这个顺序保存。
PDF 可以只记录文字在页面上的坐标,而不记录段落和分栏结构。文件的生成方式不同,复制粘贴时可能出现以下问题:
- 左右两栏的行交替出现。
- 图注插入正文段落中间。
- 页码和页眉混入正文。
- 脚注出现在引用它的句子之前。
- 行末断词的连字符被原样保留。
所以转为 Word 后,除了确认能否提取文字,还要检查阅读顺序。下文涉及图片、图注和脚注的步骤属于通用核对方法,并不表示 PDFIntact 会自动保留这些内容。
转换前先识别不同页面版式
一篇论文很少从头到尾都使用同一种版式。先划分主要页面类型:
| 页面版式 | 常见位置 | 需要注意的内容 |
|---|---|---|
| 单栏 | 标题和摘要 | 通栏标题下方可能切换为双栏 |
| 双栏 | 正文 | 必须正确识别左右栏边界 |
| 双栏加通栏图片 | 结果或讨论部分 | 确认图片前后的正文如何衔接 |
| 脚注区域 | 页面底部 | 与正文分为不同区域 |
| 参考文献 | 论文末尾 | 每条文献应保持为一个完整条目 |
不要只根据标题页选择转换方式。还应检查论文中部和参考文献部分的页面。
重建正确的阅读顺序
1. 把每一页划分成区域
区分通栏内容、左栏、右栏、页眉、页脚和脚注。简单从页面中线切开并不可靠,因为跨两栏的标题、公式、图片或表格会被一分为二。
先找出通栏元素,再分别处理它上方和下方的双栏区域。
2. 确定每栏内部的顺序
先读取左栏从上到下的内容,再读取右栏。把页码和重复页眉排除在正文之外。
段首缩进、行距和字号可以帮助识别标题与新段落。若只按坐标对所有对象排序,附近的图片和脚注仍可能混进正文。
3. 核对图片与图注的对应关系
遇到跨两栏的图片或表格时,正文可能在其上方结束,然后从下方继续。通用核对时,应确认图注没有混入周围段落,并检查图号是否正确。
PDFIntact 不保证在 Word 中保留图片或图注。如有需要,应对照原始 PDF,另行核对图号、图注及“如图 2 所示”之类的引用。
4. 单独核对脚注
脚注位于页面底部,按坐标提取时可能直接接在右栏正文后面。PDFIntact 不保证把它转换为 Word 的脚注;如有需要,应对照原始 PDF 另行创建。
逐一确认正文中的脚注标记与正确的脚注编号对应。
5. 谨慎处理行末断词
英文论文的窄栏经常在行末用连字符拆分单词。批量删除全部连字符,也会破坏原本就带连字符的复合词。只在下列条件同时成立时考虑合并:
- 连字符位于视觉上的行末。
- 下一行以英文小写字母开头。
- 合并后的写法在词典或论文其他位置作为一个单词出现。
不确定的情况应保留原样,并标记为待复核。
导出 Word 后优先检查哪些位置
先检查版式边界,再通读全文:
- 摘要切换到正文的位置
- 每页左栏结尾与右栏开头
- 前一页末尾与后一页开头
- 通栏图片或表格前后的正文
- 脚注标记及对应注释
- 各条参考文献之间的换行
这些位置最容易暴露大范围的阅读顺序错误。
应该导出为 Word 还是 Markdown
如果需要核对可编辑的正文、标题、表格和公式,可选择 Word;若要比较版本或继续进行文本处理,Markdown 往往更方便。本文对 PDFIntact 的说明仅限于这四类内容;图片、图注和脚注仍须对照原始 PDF 单独核对。
复刻原始双栏版面和恢复内容的正确顺序是两个不同目标。用于编辑时,阅读顺序清楚的单栏文档通常比外观完全模仿 PDF 的文件更实用。
PDFIntact 的免费检查在浏览器内运行,不上传原始 PDF。它会报告页数、文本层状态以及检测到的表格和图形数量,但不会展示提取文本预览,也不会验证阅读顺序。转换后仍需抽查不同页面版式和以上边界位置。