APP下载

改进的TFIDF中文本特征词加权算法研究

2015-04-30申剑博

软件导刊 2015年4期

申剑博

摘要摘要:在自动文本分类中,TFIDF算法是最为常用的特征权重计算方法。该算法运用广泛,但是存在不足:只考虑了特征词的频率和包含特征词的文档数量,没有考虑到特征词在类内和类间对权重的影响。对特征词权重计算方法进行了改进。为了解决特征词在类内均匀分布以及在类间的比重问题,提出了修正函数TFDFIDFO。实验比较发现,新的特征词权重算法能够更加精确地反映出特征词的分布情况,该算法与传统的TFIDF算法相比,在召回率、查准率和宏平均值上都有较大的提升。

关键词关键词:文本分类;TFIDF算法;特征词权重;特征词分布;宏平均值

DOIDOI:10.11907/rjdk.151008

中图分类号:TP312

文献标识码:A文章编号文章编号:16727800(2015)004006703

1概述

信息时代,每天都会产生大量数据,这些数据大部分以文本形式存储。微博留言、网上购物、网络聊天、电子邮件等产生的数据已经迈向PB级别,这些数据已经远远超过了人工分析的能力,人们得到有用信息的难度也日益增加,如何快速得到我们所需要的信息,文本分类与关键词提取可以有效解决这一难题。

文本分类所面临的困难主要有3个方面:①如何选择适当的数据集结构来表示文本;②每个文本进行分词后的特征词数量庞大,必须对高维的特征空间进行降维,以提高分类效率;③不同的权重计算方法会影响文档分类结果,要选择适当的分类算法,得到较为精确的分类结果。

不同的特征词在每个类别中的重要程度不一样,对于能够表示文本特征的词语常常会按照某个方法赋予相应的权重,以区分特征词对某一类的重要程度。……

登录APP查看全文