基于监督的RSM改进研究
2014-02-09张立民张建廷
刘 凯,张立民,张建廷,马 超
(海军航空工程学院电子信息工程系,山东烟台264001)
0 引 言
文本分析目的在于准确、高效的提取文档信息和分析文本语义。RBM[1]作为克服传统概率主题模型[2-4]后验概率难以推断缺点的无向图模型,受到越来越多的关注。RAP[5]将词汇视为泊松分布样本,较好的实现文本信息特征的提取,但存在处理不同长度文本计算难度大的问题。RSM[6]克服了RAP的缺点并衍变诸多模型如Document NADE[7,8]、Over Softmax Model[9]等。但上述算法均为无监督学习方法,对于存在类别属性的文档并没有考虑类别信息对于文本特征提取的影响,本文针对这一问题,在RSM的基础增加类别信息处理,并提出了基于监督的RSM-sRSM。新模型将不仅提高学习的收敛速度与收敛精度,而且对于文本表达更加准确。
1 RSM模型
1.1 受限玻尔兹曼机
受限玻尔兹曼机(RBM)是在玻尔兹曼机的基础上增加了限定条件形成的,即层内单元无连接、层间单元全连的两层结构(可见层和隐藏层)的双向连接马尔可夫随机场(MRF),其网络连接如图1所示。

图1 RBM单元连接
RBM的能量形式请参见文献[1],如下所示

由于层间单元是无连接的,可以很方便的推导出隐单元和可见单元的后验概率分布,分别如下所示[10]

其中sigm(x)=1/(1+exp (-x))。
1.2 RSM模型
Ruslan Salakhutdinov在文献[6]中提出了RSM,是在RBM的基础上通过将可见单元设定为多项分布样本,实现了文本的有效表示。RSM中,将每一个文本作为一个RBM的训练样本,设定v∈{1,…,K }D,其中K是词汇单词的数量,D是文本的大小,隐单元h∈{0,1 }F代表潜在语义,故可见层为一个K×D的二值矩阵(=1表示在可见单元i的位置上出现的是第k个词汇),其能量形式如下所示……p>
