基于演化超网络的中文文本分类方法
2013-10-09金理雄孙开伟
王 进,金理雄,孙开伟
(1.重庆邮电大学计算机科学与技术学院,重庆400065;2.计算智能重庆市重点实验室,重庆400065)
随着Internet应用的普及,互联网上电子文档的数量正在高速增长.为从海量电子文档中快速、准确、全面地查找和获取有效信息,近年来,文本分类技术得到了学术界的广泛关注.国外对英文文本分类技术的研究始于1950年,经过数十年的发展已经比较成熟.当前比较流行的英文文本分类方法包括:朴素贝叶斯(Naïve Bayes)[1],K 最近邻(k-nearest neighbor,KNN)[2],支持向量机(support vector machine,SVM)[3],最大熵模型[4]等方法.而国内对中文文本分类的研究起步较晚,始于20世纪80年代初期,近年来也取得了显著进展[5-7].
受生物分子网络的启发,演化超网络(evolutionary hypernetworks)最初是作为一种并行联想记忆模型被提出[8],并通过 DNA 计算实现[9].超网络由大量的超边(hyperedges)组成,具有流体性、可重置的分子结构,是学习友好的[10].超网络的结构(超边的组成)和参数(超边的权值)通过分子演化学习得到.近年来,Zhang B.T.[10]从超图的视角定义了超网络这一新颖的认知学习和记忆模型,并已将其成功应用于手写数字图像重建[9]、癌症基因挖掘[11]、证券价格预测[12]、心血管疾病诊断[13]等诸多领域.
为了建立一个高效、准确的中文文本分类系统,文中拟提出一种基于演化超网络的中文文本分类算法.对所获的中文语料进行文本预处理、特征选择和权值计算,建立演化超网络模式识别模型;给出超网络的演化算法,实现模型的识别功能;并通过与SVM,KNN两种传统的文本分类方法的对比试……