APP下载

基于DOM树的可适应性多信息块Web信息抽取

2012-08-06杨文超乔鸿

网络安全技术与应用 2012年11期
关键词:关键信息

杨文超 乔鸿

山东师范大学管理科学与工程学院 山东 250014

0 引言

Web信息抽取是一个从网页中抽取主题信息的问题。它将现有的Web信息以更为结构化的方式抽取出来。Web 信息抽取技术的核心是从Web 页面所包含的无结构或半结构的信息中识别用户感兴趣的数据,并将其转化为结构化、语义更为清晰的格式。构建Web 信息抽取器的方法有很多,这些方法大多数都是有监督的学习方法,通过学习样本网页,归纳出网页的抽取规则。但是,目前常见的信息抽取器存在的一个主要问题:从样本网页中学习到的抽取规则只适用于样本所在的网站。这些抽取器不仅维护成本高,而且可适应性差。

最近,有研究者提出了几种不同的可适应性信息抽取的方法,意在网站结构发生变化时不必修改抽取规则,然而这些方法仍然需要大量人工工作。例如:文献[1]提出一种通过聚类规则来对网页进行分块,最后对其进行剪枝,删除掉无用的信息,提取主题信息。文献[2]提出基于扩展DOM树的Web页面信息抽取,能对多信息块的Web页面进行信息抽取。文献[3]提出的一种可适应性的Web信息抽取方法,但仅仅只是针对单信息块的商品信息抽取,而对于多个信息块的网页只能抽取出第一个信息块,影响了信息抽取的精度。基于文献[3]这种思想,我们提出一种基于DOM 树的可适应性多信息块Web信息抽取,以对任何一种网页结构进行有效的信息抽取。

1 基于DOM树的多信息块信息抽取

Web信息抽取流程图如图1所示。……

登录APP查看全文

猜你喜欢

关键信息
高考考好是关键
走好关键“五步” 加强自身建设
订阅信息
展会信息
获胜关键
生意无大小,关键是怎么做?
鹏鹏猪
信息
健康信息
健康信息(九则)