基于XML的Web内容挖掘方法
2012-01-08陈建国
沈阳大学学报(自然科学版) 2012年3期
郑 霞,陈建国
(1.闽江学院计算机科学系,福建福州 350001;2.福建工程学院软件学院,福建福州 350003)
基于XML的Web内容挖掘方法
郑 霞1,陈建国2
(1.闽江学院计算机科学系,福建福州 350001;2.福建工程学院软件学院,福建福州 350003)
在分析Web内容挖掘特征的基础上,提出一种基于XML技术的Web内容挖掘模型.利用HITS算法确定权威Web页面,利用HTML Tidy工具将非XML文件经过数据清洗后转换成结构良好的XML文档,结合互联网上传统科技论文的自动抽取系统实例,采用文本聚类分类技术进行面向XML文档数据的数据挖掘.实验结果表明,该模型工作良好,可以自动、有效地提取网页内容.
Web挖掘;数据挖掘;文本聚类;非XML文档
Web数据挖掘是从浩瀚的Web信息资源中发现未知的、潜在的、有价值知识的一种技术[1].由于Web数据具有数据量庞大,页面复杂,结构各异,冗余数据多等特点,并且大部分网页是非XML文档形式,因此Web数据挖掘比传统数据挖掘更复杂,难度更大.由于XML能够将不同来源的结构化的数据很容易地结合在一起,因此给Web数据挖掘带来了很大方便[2].
目前关于XML技术和Web内容挖掘技术的结合研究已取得一定成果,例如采用直接解析HTML页面[3],或者将HTML页面转换成XML格式后存入关系数据库,然后对关系数据库展开数据挖掘[4].本文以互联网上传统科技论文的自动抽取系统为实例,提出一种基于XML的Web内容挖掘模型和关键技术.
1 Web挖掘和XML技术
1.1 Web内容挖掘
数据挖掘就是从数据库或其他信息库中的海量数据源中获取蕴含的、潜在……
登录APP查看全文
