基于树结构的Web表格信息抽取方法
2011-08-28孙全红张贞贞
华北水利水电大学学报(自然科学版) 2011年3期
孙全红,张贞贞
(华北水利水电学院,河南郑州450011)
随着信息技术的发展和Web资源的极度膨胀,网络资源传统的信息获取方式已不能满足用户的需求.因此现在面临急需解决的问题是怎样从海量的网络资源中挖掘出有价值的和感兴趣的信息.网络信息挖掘是一个极其复杂的过程,它不同于传统的数据仓库技术和简单的知识发现,它面对的海量信息不是简单的结构化数据,而常常为半结构化数据,甚至是异构型数据[1].笔者从Web表格信息抽取方法的研究及实现方面来研究基于树结构的Web表格信息抽取的建模理论,简化建模的过程,缩短实现周期,为Web信息抽取建模提供新的思考方法.
1 Web表格信息抽取的设计
1.1 系统构成
Web表格信息抽取系统是以Web表格中的数据为信息抽取对象开发的工具,具有较高的通用性.主要有以下2个工具构成[2]:
a.二叉树构建工具.此工具也是Html文档分析工具,实现对文档结构的重建,包括Html解析和二叉树构建,即将一个Html文档转化成一颗含有文本信息的二叉树,供信息抽取使用.
b.信息抽取工具.利用全文二叉树进行查找、信息抽取,并具有选项抽取等功能,即从一篇 Web文档的表格中提取出与用户感兴趣的关键词相关的表格信息.
二叉树构建工具以Html文档作为输入数据,将Html文档解析成DOM树,再将用户感兴趣的标记及其中的内容重新构建成一棵含有文本信息的二叉树.在此以表格为例进行信息抽取,设定“title(文档标题)、table(表)、td(列……
登录APP查看全文
