PDFIntact

从 PDF 中原样取出表格与正文

从 PDF 复制公式就会散架

在论文或规格书里选中公式、复制、粘贴到 Word——指数掉到基线上,分子和分母并排排开,根号孤零零地留在那里。多数时候重新敲一遍比修复更快。

原因在于 PDF 并不保存公式的结构。文件里只有指令:“在这个坐标画这个字形”。分数线是画出来的一条线,指数只是画得略高一点的小号字形。文件里没有任何地方写明哪个是分数、哪个是指数。复制只是按绘制顺序把字符收起来,上下关系就在那里丢失。

所以必须从版面把公式重新读出来。PDFIntact 找出公式块,按读到的 LaTeX 记法原样写入 Word、Markdown 和 JSON。Excel 不在其中:Excel 导出只包含表格和图表。

现在就试

用您自己的 PDF 确认

检测完全在您的浏览器内进行。文件不会被发送到任何地方,也无需注册。付款前就能看到能提取多少页、多少表格与图表。

实例

数式はこの形で書き出します

下は実際の論文PDFから取り出した数式です。数式のブロックは記法を剥がさず、そのまま残します。本文や表に紛れ込んだ上付き・下付きの記法だけは、読める形に直してから書き出します。

$$ \boldsymbol{y}(k)=\sum_{i=1}^{P}A_{i}\boldsymbol{y}(k-i)+\boldsymbol{e}(k) $$

形式ごとに、どう入るか

同じ数式でも、書き出す形式によって入り方が違います。

Word(.docx)

読み順のその位置に、等幅の段落として入ります。Wordの数式オブジェクトにはしません。

Markdown(.md)

本文の流れの中に、記法をそのまま置きます。

JSON

種別「数式」・ページ番号・ページ内の座標つきで、書き換えのない値が入ります。

Excel(.xlsx)

入りません。Excelに書き出すのは表とグラフだけです。

常见问题

从 PDF 复制公式为什么会散架?
因为 PDF 并不把公式作为公式来保存。分数线是画出来的一条线,指数只是放高一点的小号字形,文件里没有任何地方说明哪个是哪个。复制按绘制顺序读取字符,上下关系就此消失。
公式可以导出成哪些格式?
Word、Markdown 和 JSON。公式块按读到的样子保留 LaTeX 记法。Excel 不在其中,因为 Excel 导出只包含表格和图表。
在 Word 里会变成可编辑的公式对象吗?
不会。它以文本形式进入等宽字体的段落,位置按阅读顺序排列,记法原样保留。我们不会把它转换成 Word 的公式对象。
公式里的数值会是推定值吗?
不会。从形状推定数值是针对没有印出数字的图表的处理,公式块不经过它。读到什么就输出什么。即便如此,仍请把结果与原始 PDF 核对。

把其他症状也一并检测各导出格式的差异