分块主成分分析在文本特征抽取中的应用
2015-04-21洪军建
河南科技大学学报(自然科学版) 2015年6期
洪军建,珠 杰
(西藏大学 计算机科学系,西藏 拉萨 850000)
分块主成分分析在文本特征抽取中的应用
洪军建,珠 杰
(西藏大学 计算机科学系,西藏 拉萨 850000)
为了降低原始文本特征空间的维数,获得较高的分类精度与执行效率,对多种文本特征提取方法进行了研究,如卡方、互信息、信息增益、主成分分析(PCA)等。针对传统文本特征抽取方法存在的精度不高、执行效率低等问题,提出了一种基于分块主成分分析的文本特征提取算法。该算法通过K-均值词聚类进行特征词分块,再对各分块实施PCA操作抽取出更具代表性的特征项,最后使用支持向量机分类器对文本进行分类。实验结果表明:分块主成分分析的分类指标Fβ=1达到了88.7%,执行时间为353 s,能够有效提高文本分类精度与执行效率。
主成分分析;分块;特征抽取;词聚类
0 引言
随着网络的发展,互联网上涌现出大量的文本数据,处理海量数据的自动文本分类技术变得越来越重要,自动文本分类已成为处理和组织大量文档数据的关键技术[1]。对于采用向量空间模型(vector space model,VSM)的大多数分类器来说,文本预处理成为分类的瓶颈,高维的特征空间不仅增加了存储与计算的复杂度,而且其中很多特征是与分类无关的,甚至有一些是误导分类的噪声数据。为了达到降低特征空间维数、提高分类器的效率和精度的目的,需要从原始特征空间中挑选出一些具有代表性的特征。 研究发现:当特征维度高到一定程度时,分类器的精度随着特征维度增高而下降[2-3]。……
登录APP查看全文
