图谱报告PDF文件解析原理、示例与应用展望
2021-03-04刘羽,王辉,王贺
电脑知识与技术 2021年34期
关键词:数据挖掘
刘羽,王辉,王贺






















摘要:目的:研究基于PDF文件解析的图谱数据提取方法,解决“数据孤岛”问题,实现数据的有效整合。方法:通过对PDF格式的图谱报告页面结构进行拆解、分析、归纳,逐步以示例展示PDF格式图谱文件的数据提取方法。一方面说明现有的PDF文本提取技术的原理,另一方面进一步研究对图谱曲线采用坐标变换进行还原以获得逼近原始数据真实值的数据的方法,并就处理后的图谱数据的应用方向进行了展望。结论:本文的研究结果表明,以PDF格式文件为媒介,可以将各类图谱报告的转化为自定义的数据,实现有效整合实验室资源,并为图谱报告的数据挖掘及AI应用创造条件。
关键词:PDF;图谱;Python;数据挖掘
中图分类号:R95 文献标识码:A
文章编号:1009-3044(2021)34-0134-07
1 引言
仪器分析是现代科学研究的重要手段,在研究中,通常会采用不同的方法(如液相色谱、气相色谱、质谱、核磁共振、热分析等)对同一目标从多角度进行研究,其产生的图谱直接或间接地反映出了被研究对象特定的物理化学性质[1-3]。这种研究策略在药学类的检验及研究领域极为常见。
现代分析仪器通常采用仪器+PC+工作软件/工作站的形式组成功能完整的系统:处理后的样品通过仪器上不同原理的传感器检测,获得模拟的电信号,经过模拟电信号/数字信号之间的转换,成为PC设备可以处理的二进制数据,再通过PC所搭载的工作软件/工作站中所包含相关函数的处理,得到可进行各类计算的图谱数据,并生成各类专属格式的数据文件,报告管理程序通过调用报告模板和图谱数据生成图谱报告。……
登录APP查看全文
