PDFIntact

从 PDF 中原样取出表格与正文

从检测报告和分析证书 PDF 中提取表格,生成可与原文件核对的 Excel 数据

检测报告 PDF 数据转 Excel:避免手工录入并保留核对依据

将检测报告、检验报告和分析证书中的测量结果转入 Excel,同时保留样品编号、单位、条件、限定符及来源页的实用流程。

PDFIntact 编辑团队发布

脱离上下文的测量值不能直接复用

实验室检测报告、检验报告或分析证书(COA)中的结果不只是一串数字。还必须知道检测的是哪个样品、采用什么条件、依据什么限值,以及数值的单位。只复制结果列虽然快,却会得到一份难以可靠核对和汇总的 Excel。

提取前先定义 Excel 字段。根据文件类型,通常包括:

  • 样品名称、批号或生产批次
  • 检测项目或分析物
  • 测量结果
  • 单位
  • 技术要求或接受范围
  • 合格/不合格结论
  • 检测条件
  • 来源 PDF 页码

有些共用单位或检测条件印在表格上方,也要能追溯到所有适用的数据行。

把 PDF 内容分成三类

1. 报告级信息

报告编号、签发日期、委托方和样品名称可能适用于整份报告或整页。即使不在表格单元格内,它们也是识别数据来源所必需的字段。

2. 表格结果

检测项目、要求、实测结果和判定的含义依赖行列关系。应将它们作为结构化单元格提取,而不是压成一串文本。

3. 限定符和异常说明

“低于检出限”“估算值”“复测”或“无法测定”等内容,不能转为空白或零。应另设字段,保留原始限定符或备注。

检测报告 PDF 转 Excel 的步骤

第一步:确定处理范围

带目录和附件的报告可能重复出现相似表格。转换前列出每张目标表的页码和标题。即使检测项目名称相同,只要样品或检测条件不同,就应先按独立表格处理。

第二步:检查多级表头

有些报告把检测类别放在第一层表头,具体项目放在下一层。合并的上级单元格决定了每个子列的含义。取消合并前,把上级值补到所有适用的列。

纵向合并的样品名称也要谨慎。不要看到 Excel 中的空白就一律向下填充;应先确认下面的行确实属于同一个样品。

第三步:保存未经修改的原始文本

<0.01N.D.Pass 都不是普通数值。解释之前就删除符号,会破坏原始信息。

在 Raw 工作表中保留提取出的原始字符串,在另一个 Processed 工作表中按照书面规则拆分单位、转换数值。原始值和处理值并存,之后才能审计每一步处理。

第四步:判断表格是否跨页延续

合并两段表格前,核对以下信号:

  • 表格名称或编号一致。
  • 列数和列标题一致。
  • 前一页末行与后一页首行构成合理顺序。
  • 文件没有切换到其他样品或检测条件。

如果这些信号不一致,宁可放在不同工作表,也不要强行拼接。

第五步:与原始 PDF 逐项核对

不要只抽查最整齐、最容易读的数值。抽查范围应包括:

  1. 第一行和最后一行数据
  2. 带多位小数的数值
  3. 同时包含数字 0 和字母 O 的编号
  4. 负数、小于号和范围值
  5. 带脚注或限定符的结果
  6. 分页前后的相邻数据行

原表有合计时可以重新计算,但不要把合计一致视为全部正确。单个数值仍可能被放到了错误的行或列。

分开保存原始数据与处理结果

工作表 内容
Raw 未修改的提取表格和原始字符串
Processed 统一后的表头、拆分后的单位和转换后的数值
Provenance 来源文件、页码、转换日期、复核人和已知问题

原始 PDF 应单独保存,并通过报告编号或文件编号与工作簿关联。将来收到修订版报告时,就能确认每份 Excel 对应哪个 PDF 版本。

行列检测、重复表头识别和 Excel 导出可以自动化;但两段内容是否属于同一张表、低于检出限的值如何统计、参考结果是否应计入最终结果,都取决于后续用途,需要明确记录。

PDFIntact 的免费检查在浏览器内完成,不上传原始文件。它会报告页数、文本层状态以及检测到的表格和图形数量,但不会展示提取结果预览,也不会确认最终行、列和值是否正确。将数据用于报告或分析前,务必与原始 PDF 核对。

无需上传即可检查

先查看这份 PDF 中可以提取哪些内容

免费检查在浏览器内运行,不会上传原始文件。

免费检查检测报告 PDF