Hadoop平台下垃圾邮件过滤技术研究*
2015-09-21刘广钟
网络安全与数据管理 2015年19期
李 毅,刘广钟
(上海海事大学 信息工程学院,上海 201306)
0 引言
电子邮件作为网络最基本的服务,已成为人们生活中不可或缺的一部分。截止2014年12月,中国网民规模达到6.49亿,电子邮件用户规模3.9亿,占网民总数的60.1%[1]。在其中充斥着的海量垃圾邮件给人们的生活带来了困扰,如何处理海量垃圾邮件已经成为亟待解决的重要问题。
在目前存在的垃圾邮件过滤技术中,以过滤垃圾邮件时使用的过滤方法作为分类点,可将这些垃圾邮件过滤技术分为以下三种:基于黑白名单的过滤技术[2]、基于规则的过滤技术[3]、基于内容统计的过滤技术。其中,贝叶斯垃圾邮件过滤技术分类能力和准确性较高,但其前期需要对训练样本进行大量的训练学习,对训练样本依赖性较强。海量垃圾邮件的出现使得传统的方法无法满足需要,随着云计算Hadoop的出现和发展,Hadoop MapReduce模型为海量垃圾邮件的过滤提供了新思路。
针对传统贝叶斯垃圾邮件过滤算法的缺点,本文对贝叶斯垃圾邮件过滤算法与MapReduce编程模型的结合进行了研究,提出了垃圾邮件过滤的数学模型,并在此基础上对判定邮件所属类别的决策分类方法给出了一定的改进。
1 研究基础介绍
1.1 贝叶斯定理
贝叶斯定理由条件概率和全概率组成,主要用于在已知事件A发生的条件下,判断A是伴随着{B1,B2,…,Br}中哪个事件发生。E是随机试验,对于E的每一次事件A发生的概率,记为 P(A)。设A,B为两个事件,且 P(A)>0。如果两个事件A和B不是相互独立的,并且已知事件B中的一个事件已经发生,则能得到关于P(A)的信息。……
登录APP查看全文
