基于特征噪声加权的特征权重算法改进*
2012-08-20杨天奇赵小厦
网络安全与数据管理 2012年3期
赵 航 ,杨天奇 ,赵小厦
(1.暨南大学 信息科学技术学院,广东 广州 510632;2.华南师范大学 计算机学院,广东 广州 510631)
随着信息技术的发展,信息极度膨胀,人们迫切希望找到一种信息自动处理技术。文本分类作为信息处理的技术之一,由于其能对信息进行分类,使得获取信息更加容易,因而得到广泛应用。在文本分类的算法中,空间向量法中的TF-IDF算法由于其以词频TF和逆文档频数IDF的乘积作为向量坐标系的值,具有简单、直观、处理速度快的优点,得到广泛应用。但在理论和实际应用中有很大局限性,以至于其精度在各种文本分类中一直是较低的[1]。
本文针对噪声特征对TF-IDF算法逆文档频率(IDF)影响进行分析,提出了一种IDF加权方法,调整对IDF产生影响的特征噪声权重,有效减少了算法对噪声的影响,提高了TF-IDF算法的精度和健壮性。虽然已有很多研究者对TF-IDF算法做了改进,从特征选择上减少噪声特征的选择,但特征噪声在分类中出现是不可避免的。
1 向量空间算法的分析
向量空间算法的基本思想是用词袋法表示文本,将文本看做特征空间的一个向量,用两个向量之间的夹角来衡量两个文本之间的相似度。用TF-IDF值表示向量空间的一个特征值权重。
词语权重计算唯一的准则就是要最大限度地区分不同的文档。所以针对词语权重的计算,主要考虑3个因素[2]:

(2)词语的倒排文档频率 idf(inverse document frequency):该词语在文档中分布情况的量化,常用计算方法[3]为 idf(Tk)=log2(N/nk+L)。 其中 N 为文档集合中的文档数目;……
登录APP查看全文
