基于TAN结构的贝叶斯文本分类器研究
2012-08-13王景中易路杰
网络安全技术与应用 2012年1期
王景中 易路杰
北方工业大学信息工程学院 北京 100144
0 引言
朴素贝叶斯分类器是贝叶斯分类中一种最常见且原理简单,实际应用很成功的方法。朴素贝叶斯分类器中的“朴素”主要是指假设各属性间相互独立。在文本分类中,假设不同的特征项在确定的类别下的条件概率分布相互独立,这样在计算特征项之间的联合分布概率时可以大大提高分类器的速度。目前,很多文本分类系统都采用贝叶斯分类算法,在邮件分类、电子会议、信息过滤等方面都有了广泛的应用。
1 朴素贝叶斯分类器
1.1 贝叶斯公式介绍
贝叶斯定理为:设S为试验E的样本空间,A为E的事件,B1,B2,…Bn为S的一个划分,且有P(A)>0,P(Bi)>0(i=1,2,…n),则有:

1.2 贝叶斯文本分类
贝叶斯文本分类模型是一种基于统计方法的分类模型,是现有文本分类算法中最有效的方法之一。其基本原理是:通过样本数据的先验概率信息计算确定事件的后验概率。在文本分类中的应用为:通过计算给定文本的特征值在样本库中某一确定类Ci中的先验概率,得出给定文本的特征值属于Ci类的后验概率,再通过比较,得出后验概率最大的即为给定文本最可能属于的类别。因此,贝叶斯类别判别式为:

本文采用布尔表示法描述文本,每个文本表示为特征矢量(w1,w2,…w),V为特征词表,为特征词表总词数,V=(B1, B2,…B)。特征矢量中的wi={0,1},1表示特征词表中的第i个词出现,0表示没有出现。
根据贝叶斯公式:

式中P( Ci)为样本集中属于Ci类的概率,为Ci类中给定文本特征词的概率。……
登录APP查看全文
