APP下载

基于演化超网络的中文文本分类方法

2013-10-09金理雄孙开伟

江苏大学学报(自然科学版) 2013年2期
关键词:分类文本

王 进,金理雄,孙开伟

(1.重庆邮电大学计算机科学与技术学院,重庆400065;2.计算智能重庆市重点实验室,重庆400065)

随着Internet应用的普及,互联网上电子文档的数量正在高速增长.为从海量电子文档中快速、准确、全面地查找和获取有效信息,近年来,文本分类技术得到了学术界的广泛关注.国外对英文文本分类技术的研究始于1950年,经过数十年的发展已经比较成熟.当前比较流行的英文文本分类方法包括:朴素贝叶斯(Naïve Bayes)[1],K 最近邻(k-nearest neighbor,KNN)[2],支持向量机(support vector machine,SVM)[3],最大熵模型[4]等方法.而国内对中文文本分类的研究起步较晚,始于20世纪80年代初期,近年来也取得了显著进展[5-7].

受生物分子网络的启发,演化超网络(evolutionary hypernetworks)最初是作为一种并行联想记忆模型被提出[8],并通过 DNA 计算实现[9].超网络由大量的超边(hyperedges)组成,具有流体性、可重置的分子结构,是学习友好的[10].超网络的结构(超边的组成)和参数(超边的权值)通过分子演化学习得到.近年来,Zhang B.T.[10]从超图的视角定义了超网络这一新颖的认知学习和记忆模型,并已将其成功应用于手写数字图像重建[9]、癌症基因挖掘[11]、证券价格预测[12]、心血管疾病诊断[13]等诸多领域.

为了建立一个高效、准确的中文文本分类系统,文中拟提出一种基于演化超网络的中文文本分类算法.对所获的中文语料进行文本预处理、特征选择和权值计算,建立演化超网络模式识别模型;给出超网络的演化算法,实现模型的识别功能;并通过与SVM,KNN两种传统的文本分类方法的对比试……

登录APP查看全文

猜你喜欢

分类文本
分类算一算
垃圾分类的困惑你有吗
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
给塑料分分类吧
如何快速走进文本