基于改进TFIDF算法的邮件分类技术
2018-08-21陶峰,汤鲲,程光
计算机技术与发展 2018年8期
陶 峰,汤 鲲,程 光
(1.武汉邮电科学研究院,湖北 武汉 430074;2.南京烽火星空通信发展有限公司,江苏 南京 210019;3.东南大学 计算机科学与工程学院,江苏 南京 210096)
0 引 言
中国互联网协会反垃圾邮件中心发表的《2014年第四季度中国反垃圾邮件状况调查报告》,根据调查结果估算,用户平均每周接收到的电子邮件数量为35.0封,平均每周接收到的垃圾邮件数量为14.3封,收到垃圾邮件的比例是41.0%。根据中国互联网协会反垃圾邮件中心的调查显示,有超过50%的用户因为反垃圾邮件功能弱而影响对电子邮件的满意程度。因此,如何实现对这类垃圾邮件的准确过滤成为近年来热门的研究课题。
垃圾邮件分类方法用的比较多的有朴素贝叶斯(Naive Bayes)[1-2]、神经网络[3]、K-近邻[4]、支持向量机(SVM)[5-6]等。由于邮件分类算法都是建立在特征项提取基础上的,因此特征项提取直接影响着邮件的分类效果。
TFIDF[7-10]是广泛使用的权值计算方法,用术语频率乘以逆文档来表示特征项的权值。近年来,不少学者将TFIDF算法用于特征提取,并在实验中取得了较好的效果。目前,在邮件分类中常用的特征提取方法有:信息增益[11-12]、互信息[13]、期望交叉熵、文本证据权、CHI统计[14]以及TFIDF算法。TFIDF因其便于理解、操作简单、时间复杂度低等优点而应用广泛,但是仍然存在很多不足。该方法只考虑了特征词文档的绝对数量和特征词在某类邮件中的词频,没有考虑到特征词在类中的分布情况和特征词在其他类邮件中的词频,高估了低频词的作用并低估了高频词的作用。……
登录APP查看全文
