自适应Web页面数据抽取方法*
2016-12-13陈晓雷李晓光宋宝燕
计算机与数字工程 2016年11期
王 龙 陈晓雷 李晓光 宋宝燕
(辽宁大学信息学院 沈阳 110036)
自适应Web页面数据抽取方法*
王 龙 陈晓雷 李晓光 宋宝燕
(辽宁大学信息学院 沈阳 110036)
针对Web页面数据抽取问题,提出了一种基于抽取模板的自适应Web页面数据抽取方法。给出了自适应web数据抽取的整体流程,详细介绍了抽取模板中抽取规则和自适应搜索规则的定义方式,web页面与抽取模板的匹配方法,以及抽取路径失效后目标数据的搜索与抽取模板的自适应修改过程。实验结果表明,基于抽取模板的自适应web页面数据抽取方法的召回率和查准率都达到95%以上,方法中的自适应搜索规则有效地减少了抽取模板的制定数量。
自适应; 数据抽取; Web数据; 抽取模板; 匹配度
Class Number TP391.1
1 引言
Web数据抽取是Web数据挖掘工作中的一步重要的过程[1]。Web数据抽取就是将Web页面上半结构化的数据按照一定的方法抽取出来,保存为结构化格式,如保存为XML文件或者存储到数据库中等[2~3]。传统的Web数据抽取方法大多是针对某一类特定信息源的数据抽取,主要由一系列预先定义的抽取规则以及这些规则的执行代码组成,并没有充分利用页面数据的结构特征,且对页面的结构有一定要求,若页面结构是动态变化的便不能很准确的进行数据抽取,导致数据抽取失败。
Web数据抽取技术可分为基于页面DOM结构的数据抽取技术[4~9]、基于统计理论的数据抽取技术[10~12]和基于页面视觉特征的数据抽取技术[13~15]。其中基于页面DOM结构的数据抽取技术应用最为广泛。……
登录APP查看全文
