APP下载

自适应Web页面数据抽取方法*

2016-12-13陈晓雷李晓光宋宝燕

计算机与数字工程 2016年11期
关键词:页面规则方法

王 龙 陈晓雷 李晓光 宋宝燕

(辽宁大学信息学院 沈阳 110036)



自适应Web页面数据抽取方法*

王 龙 陈晓雷 李晓光 宋宝燕

(辽宁大学信息学院 沈阳 110036)

针对Web页面数据抽取问题,提出了一种基于抽取模板的自适应Web页面数据抽取方法。给出了自适应web数据抽取的整体流程,详细介绍了抽取模板中抽取规则和自适应搜索规则的定义方式,web页面与抽取模板的匹配方法,以及抽取路径失效后目标数据的搜索与抽取模板的自适应修改过程。实验结果表明,基于抽取模板的自适应web页面数据抽取方法的召回率和查准率都达到95%以上,方法中的自适应搜索规则有效地减少了抽取模板的制定数量。

自适应; 数据抽取; Web数据; 抽取模板; 匹配度

Class Number TP391.1

1 引言

Web数据抽取是Web数据挖掘工作中的一步重要的过程[1]。Web数据抽取就是将Web页面上半结构化的数据按照一定的方法抽取出来,保存为结构化格式,如保存为XML文件或者存储到数据库中等[2~3]。传统的Web数据抽取方法大多是针对某一类特定信息源的数据抽取,主要由一系列预先定义的抽取规则以及这些规则的执行代码组成,并没有充分利用页面数据的结构特征,且对页面的结构有一定要求,若页面结构是动态变化的便不能很准确的进行数据抽取,导致数据抽取失败。

Web数据抽取技术可分为基于页面DOM结构的数据抽取技术[4~9]、基于统计理论的数据抽取技术[10~12]和基于页面视觉特征的数据抽取技术[13~15]。其中基于页面DOM结构的数据抽取技术应用最为广泛。……

登录APP查看全文

猜你喜欢

页面规则方法
大狗熊在睡觉
刷新生活的页面
撑竿跳规则的制定
数独的规则和演变
让规则不规则
TPP反腐败规则对我国的启示
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
同一Word文档 纵横页面并存