APP下载

基于K—means算法的神经网络文本分类算法研究

2014-04-29卢曼丽

中国管理信息化 2014年21期

卢曼丽

[摘 要] 本文在分析文本分类算法的一般模型和现有技术后,针对传统神经网络算法存在的问题,提出了一种引入K-means算法用于训练RBF神经网络的径向基函数中心,改善误差反向传播(BP)神经网络分类算法收敛速度较慢的缺点。实验结果表明,改进后的RBF网络与BP网络、RBF网络相比,在取得较好分类精度和召回率情况下,具有较高的运算速度和较强的非线性映射能力。

[关键词] 文本分类;RBF神经网络;K-means算法

doi : 10 . 3969 / j . issn . 1673 - 0194 . 2014 . 21. 059

[中图分类号] TP31 [文献标识码] A [文章编号] 1673 - 0194(2014)21- 0080- 03

1 引 言

现代社会信息量呈几何级数增长,为了从海量的数据中找到自己需要的信息,提高检索的效率,信息自动分类成为一个重要的工具。文本分类是信息自动分类的一个重要的研究领域。其目标是在分析文本内容的基础上,将一个或多个适合的类别分配给文本,用以提高文本检索、存储等应用的处理效率[1]。目前在文本自动分类领域,已有大量传统的分类方法应用其中,但各有其不足之处。如,朴素的贝叶斯方法(Navie Bayers)在数据属性个数较多或属性之间关联性较大时,文本分类的效率低;决策树方法对于处理缺失数据时较困难,会出现过度拟合问题,数据属性间的相关性容易被忽略;传统的支持向量机方法对于大规模训练样本难以实施[2];传统的神经网络在文本特征维数过多时会导致神经网络收敛速度较慢[3]。因此,为找到一个执行效率、精确程度和召回率都相对理想的算法,本文提出一个结合K-means算法的神经网络分类文本算法,改进了传统神经网络分类算法不易收敛的缺点,有了更高的运算速度和准确度。……

登录APP查看全文