PDFIntact

从 PDF 中原样取出表格与正文

PDF 表格贴进 Excel 就错位

选中 PDF 里的表格,复制,粘贴到 Excel —— 全都挤进一列,行开始错位,合并的表头散成一片。数字列越多,手工还原花的时间越长。

成因是 PDF 里根本没有「表格」这回事。它的内容只是一串指令:「在这个坐标画这个字」「在这里画一条线」。在眼里,框线和数字构成表格;在文件里,它们彼此毫无关系。复制只是按绘制顺序抓取字符,行列的对应就是在这里丢失的。

所以结构必须从坐标重建。PDFIntact 分析版面,判断哪个单元格属于哪一行哪一列、哪里存在合并,再把它们写成 Excel 里真正的合并单元格。

现在就试

用您自己的 PDF 确认

检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。

实例

取り出せるもの

  • 罫線 — 引いて書き出します。罫線が無いと結合セルの範囲が読めず、元のPDFと照合できません
  • 結合セル — 階層のある見出し行(横方向・縦方向)を再現します
  • 列見出し・行見出しの区別 — 列見出しは薄い網掛けと太字。行見出しは太字だけにします(都道府県名などの行見出しまで塗ると、シート全体がまだらになって構造が読めなくなるため)
  • 確度 — 各表の先頭に、読み取り値か推定値かの帯を置きます

本文も必要な場合は、同じ変換結果から Word・Markdown でも書き出せます。形式ごとに何が入るかもご確認ください。

常见问题

PDF 表格为什么在 Excel 里会错位?
因为 PDF 并不把表格存成表格。它存的是「在这个坐标画这个字」「在这里画一条线」的指令,两者之间没有任何关联。复制按绘制顺序读取字符,于是行与列就散了。
合并单元格会保留吗?
会。横向与纵向合并的多层表头都会在 Excel 中还原为合并单元格,并画出框线,让您一眼看清每处合并的范围,便于与原始 PDF 核对。
表格特别多的文件怎么处理?
每个表格成为一张工作表,表名带页码。表格与图表超过 40 个时,输出改为目录、表格、图表三张工作表,并在目录中提供内部链接——几十个标签页会变得无法使用。
怎么知道数字有没有读对?
每个表格都带有可信度标记,表明数值是读到的、推测的,还是读不出来的。读不出来的单元格会被标出而不是悄悄留空,让您知道该核对哪里。

把其他症状也一并检测各导出格式的差异