APP下载

基于XML的Web内容挖掘方法

2012-01-08陈建国

沈阳大学学报(自然科学版) 2012年3期
关键词:页面数据挖掘文本

郑 霞,陈建国

(1.闽江学院计算机科学系,福建福州 350001;2.福建工程学院软件学院,福建福州 350003)

基于XML的Web内容挖掘方法

郑 霞1,陈建国2

(1.闽江学院计算机科学系,福建福州 350001;2.福建工程学院软件学院,福建福州 350003)

在分析Web内容挖掘特征的基础上,提出一种基于XML技术的Web内容挖掘模型.利用HITS算法确定权威Web页面,利用HTML Tidy工具将非XML文件经过数据清洗后转换成结构良好的XML文档,结合互联网上传统科技论文的自动抽取系统实例,采用文本聚类分类技术进行面向XML文档数据的数据挖掘.实验结果表明,该模型工作良好,可以自动、有效地提取网页内容.

Web挖掘;数据挖掘;文本聚类;非XML文档

Web数据挖掘是从浩瀚的Web信息资源中发现未知的、潜在的、有价值知识的一种技术[1].由于Web数据具有数据量庞大,页面复杂,结构各异,冗余数据多等特点,并且大部分网页是非XML文档形式,因此Web数据挖掘比传统数据挖掘更复杂,难度更大.由于XML能够将不同来源的结构化的数据很容易地结合在一起,因此给Web数据挖掘带来了很大方便[2].

目前关于XML技术和Web内容挖掘技术的结合研究已取得一定成果,例如采用直接解析HTML页面[3],或者将HTML页面转换成XML格式后存入关系数据库,然后对关系数据库展开数据挖掘[4].本文以互联网上传统科技论文的自动抽取系统为实例,提出一种基于XML的Web内容挖掘模型和关键技术.

1 Web挖掘和XML技术

1.1 Web内容挖掘

数据挖掘就是从数据库或其他信息库中的海量数据源中获取蕴含的、潜在……

登录APP查看全文

猜你喜欢

页面数据挖掘文本
大狗熊在睡觉
刷新生活的页面
探讨人工智能与数据挖掘发展趋势
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
基于并行计算的大数据挖掘在电网中的应用
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
一种基于Hadoop的大数据挖掘云服务及应用
如何快速走进文本
基于GPGPU的离散数据挖掘研究