APP下载

基于特征噪声加权的特征权重算法改进*

2012-08-20杨天奇赵小厦

网络安全与数据管理 2012年3期
关键词:分类特征文本

赵 航 ,杨天奇 ,赵小厦

(1.暨南大学 信息科学技术学院,广东 广州 510632;2.华南师范大学 计算机学院,广东 广州 510631)

随着信息技术的发展,信息极度膨胀,人们迫切希望找到一种信息自动处理技术。文本分类作为信息处理的技术之一,由于其能对信息进行分类,使得获取信息更加容易,因而得到广泛应用。在文本分类的算法中,空间向量法中的TF-IDF算法由于其以词频TF和逆文档频数IDF的乘积作为向量坐标系的值,具有简单、直观、处理速度快的优点,得到广泛应用。但在理论和实际应用中有很大局限性,以至于其精度在各种文本分类中一直是较低的[1]。

本文针对噪声特征对TF-IDF算法逆文档频率(IDF)影响进行分析,提出了一种IDF加权方法,调整对IDF产生影响的特征噪声权重,有效减少了算法对噪声的影响,提高了TF-IDF算法的精度和健壮性。虽然已有很多研究者对TF-IDF算法做了改进,从特征选择上减少噪声特征的选择,但特征噪声在分类中出现是不可避免的。

1 向量空间算法的分析

向量空间算法的基本思想是用词袋法表示文本,将文本看做特征空间的一个向量,用两个向量之间的夹角来衡量两个文本之间的相似度。用TF-IDF值表示向量空间的一个特征值权重。

词语权重计算唯一的准则就是要最大限度地区分不同的文档。所以针对词语权重的计算,主要考虑3个因素[2]:

(2)词语的倒排文档频率 idf(inverse document frequency):该词语在文档中分布情况的量化,常用计算方法[3]为 idf(Tk)=log2(N/nk+L)。 其中 N 为文档集合中的文档数目;……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征