从检测报告和分析证书 PDF 中提取表格,生成可与原文件核对的 Excel 数据
检测报告 PDF 数据转 Excel:避免手工录入并保留核对依据
将检测报告、检验报告和分析证书中的测量结果转入 Excel,同时保留样品编号、单位、条件、限定符及来源页的实用流程。
脱离上下文的测量值不能直接复用
实验室检测报告、检验报告或分析证书(COA)中的结果不只是一串数字。还必须知道检测的是哪个样品、采用什么条件、依据什么限值,以及数值的单位。只复制结果列虽然快,却会得到一份难以可靠核对和汇总的 Excel。
提取前先定义 Excel 字段。根据文件类型,通常包括:
- 样品名称、批号或生产批次
- 检测项目或分析物
- 测量结果
- 单位
- 技术要求或接受范围
- 合格/不合格结论
- 检测条件
- 来源 PDF 页码
有些共用单位或检测条件印在表格上方,也要能追溯到所有适用的数据行。
把 PDF 内容分成三类
1. 报告级信息
报告编号、签发日期、委托方和样品名称可能适用于整份报告或整页。即使不在表格单元格内,它们也是识别数据来源所必需的字段。
2. 表格结果
检测项目、要求、实测结果和判定的含义依赖行列关系。应将它们作为结构化单元格提取,而不是压成一串文本。
3. 限定符和异常说明
“低于检出限”“估算值”“复测”或“无法测定”等内容,不能转为空白或零。应另设字段,保留原始限定符或备注。
检测报告 PDF 转 Excel 的步骤
第一步:确定处理范围
带目录和附件的报告可能重复出现相似表格。转换前列出每张目标表的页码和标题。即使检测项目名称相同,只要样品或检测条件不同,就应先按独立表格处理。
第二步:检查多级表头
有些报告把检测类别放在第一层表头,具体项目放在下一层。合并的上级单元格决定了每个子列的含义。取消合并前,把上级值补到所有适用的列。
纵向合并的样品名称也要谨慎。不要看到 Excel 中的空白就一律向下填充;应先确认下面的行确实属于同一个样品。
第三步:保存未经修改的原始文本
<0.01、N.D.、— 和 Pass 都不是普通数值。解释之前就删除符号,会破坏原始信息。
在 Raw 工作表中保留提取出的原始字符串,在另一个 Processed 工作表中按照书面规则拆分单位、转换数值。原始值和处理值并存,之后才能审计每一步处理。
第四步:判断表格是否跨页延续
合并两段表格前,核对以下信号:
- 表格名称或编号一致。
- 列数和列标题一致。
- 前一页末行与后一页首行构成合理顺序。
- 文件没有切换到其他样品或检测条件。
如果这些信号不一致,宁可放在不同工作表,也不要强行拼接。
第五步:与原始 PDF 逐项核对
不要只抽查最整齐、最容易读的数值。抽查范围应包括:
- 第一行和最后一行数据
- 带多位小数的数值
- 同时包含数字 0 和字母 O 的编号
- 负数、小于号和范围值
- 带脚注或限定符的结果
- 分页前后的相邻数据行
原表有合计时可以重新计算,但不要把合计一致视为全部正确。单个数值仍可能被放到了错误的行或列。
分开保存原始数据与处理结果
| 工作表 | 内容 |
|---|---|
| Raw | 未修改的提取表格和原始字符串 |
| Processed | 统一后的表头、拆分后的单位和转换后的数值 |
| Provenance | 来源文件、页码、转换日期、复核人和已知问题 |
原始 PDF 应单独保存,并通过报告编号或文件编号与工作簿关联。将来收到修订版报告时,就能确认每份 Excel 对应哪个 PDF 版本。
行列检测、重复表头识别和 Excel 导出可以自动化;但两段内容是否属于同一张表、低于检出限的值如何统计、参考结果是否应计入最终结果,都取决于后续用途,需要明确记录。
PDFIntact 的免费检查在浏览器内完成,不上传原始文件。它会报告页数、文本层状态以及检测到的表格和图形数量,但不会展示提取结果预览,也不会确认最终行、列和值是否正确。将数据用于报告或分析前,务必与原始 PDF 核对。