基于优化类中心分类算法的文本分类研究
2011-08-30邵华清
科技传播 2011年18期
王 斌,邵华清,刘 振
1.佳木斯大学信息电子技术学院,黑龙江佳木斯 154007
2.佳木斯大学经济管理学院,黑龙江佳木斯 154007
3.桂林理工大学,广西桂林 541004
0 引言
当前,随着计算机技术的飞速发展,各类电子邮件和电子文档以前所未有速度的迅速增长,用户如何能从海量文本中快速准确的获取有效的信息,是人们普遍关注的问题。文本形式是互联网上大部分信息的载体,文本的识别的速度决定了是否能高效获取信息的速度。文本分类识别技术可以把海量但缺乏结构的文本数据组织成规范的文本数据,以达到提高检索信息和利用信息的效率的目的。文本分类已经成为组织和管理文本数据的重要形式。传统的人工分类已经不能满足如今的需要,它耗费大量的人力、物力和精力,并且分类结果一致性不高。本文针对传统类中心分类算法由于训练文档分散,不能准确的表示各类别的中心向量,提出了优化算法,从而提高分类准确度。
1 类中心分类算法
文本分类的训练集是已经分类好的文本,这些分类好的文本都具有各自类别的特点,我们可以通过学习这些分类好的文本,提取出代表每一类别各自的特点,这些特点能唯一的代表一个类别。在用向量空间模型表示的文本中,可以通过提取能代表该类别的特征项来表示类别。类中心分类算法是典型的应用代表类别特点的特征项来表示类别的算法。它具有容易理解、思路清晰、分类效果好等优点。……
登录APP查看全文
