基于索引路径的深度网页数据抽取改良
2012-09-30乐丁惕
海南大学学报(自然科学版) 2012年4期
乐丁惕
(闽江学院 计算机科学系,福建 福州350108)
随着Internet和通信技术的快速发展和广泛普及,Web页面数量急剧增加,已成为人们获取信息的主要渠道之一.目前,主流的搜索引擎基本上只收集了Internet上的静态页面(Surface Web),而这些静态页面只是其中小部分信息,其余大部分信息存放于Web中的在线数据库,对传统的搜索引擎是不可见的,这部分信息称为深度网页(Deep Web)[1].
Deep Web信息集成系统是为了有效利用海量的Deep Web信息而提出的解决方案,Web数据抽取是Deep Web信息集成系统的关键,是指通过技术手段将Web页面上的数据抽取出来,保存为XML文档或关系模式[2].对DEIP(Data Extraction based on Index Path)算法进行了改进,首先将Deep Web查询结果页面规范化为XML格式,然后在遍历XML文档的过程中确定待抽取数据路径集合,最后根据该集合完成数据抽取.
1 数据规范化
Web数据抽取是指将Web作为信息源,把分布在其上的用户感兴趣的查询结果抽取出来[3].然而,由于Web文档普遍是由半结构化标记语言HTML组成的,其语法规则比较宽松,且网站往往会在网页中加入大量的修饰性属性.因此返回的网页文件无法直接用于数据抽取,需要进行预处理:
1)补全未配对的tag;
2)滤掉修饰性属性.
以上过程称之为数据规范化,获取更易于数据抽取的XML文件.
2 DEIP算法
不同的网站,其页面布局风格往往有极大的差异,有效数据的存储位置也大不相同.但对于同一个网站而言,输入关键词后其返回的不同页面中,有效数据的存储位置是相同的.换句话说,对于同一个网站……
登录APP查看全文