基于改进信息增益的垃圾邮件过滤研究
2012-07-13翟军昌车伟伟刘艳丽康建军
电子设计工程 2012年13期
翟军昌,车伟伟,刘艳丽,康建军
(1.渤海大学 辽宁 锦州 121000;2.沈阳大学 辽宁 沈阳 110044;3.铁岭市清河区教育局 辽宁 铁岭 112003)
垃圾邮件日益泛滥产生一些列的问题,如导致邮件服务器的运行效率降低、产生网络拥塞和网络安全等。随着垃圾邮件技术手法越来越复杂,如隐藏邮件头等[1],垃圾邮件更加具有攻击性,而且垃圾邮件的危害更大,因此垃圾邮件过滤研究具有重要的现实意义。目前针对垃圾邮件的处理主要以过滤技术为主,其中基于机器学习方法的垃圾邮件过滤技术应用研究最多,如 SVM、KNN、Winnow、Bayes等方法[2]。 机器学习的方法将垃圾邮件过滤看成一个分类问题,首先收集大量合法邮件和垃圾邮件作为样本,然后指导过滤器对收集到的邮件样本进行学习,最后通过训练好的过滤器对新到达的邮件进行最终分类。过滤器通过对邮件样本的训练和学习可以自动获得垃圾邮件的特征,并根据垃圾邮件特征的变化准确的对垃圾邮件进行过滤。
在实际使用中,用户宁愿接收更多的垃圾邮件,也不愿意将合法邮件误判为垃圾邮件,此外不同的用户对于同一封邮件的决策也不同,因此如何有效提取邮件样本的特征,降低对合法邮件的误判,显得尤为重要。在垃圾邮件过滤中,如何有效的选取邮件特征词时垃圾邮件过滤的关键问题之一[3-4]。文中针对垃圾邮件过滤中特征项选择问题,提出了一种改进的信息增益的方法提取邮件的特征项,并结合最小风险贝叶斯分类器对邮件过滤,实验结果表明改进后的方法降低了对合法邮件的误判。……
登录APP查看全文
