一种基于局部词位置相对定位的非概率主题模型
2020-09-09张新豪陈知行
张新豪 陈知行
1(黄河科技学院现代教育技术中心 河南 郑州 450063)2(北京理工大学自动化学院 北京 100081)
0 引 言
在文本分类、信息检索或语言模型生成等文本处理应用中,词位置的表示是非常重要的。例如,n-Gram模型由于其简洁和高效而广受欢迎。n-Gram是一种基于统计语言模型的算法,其基本思想是将文本的内容按照字节进行大小为n的滑动窗口操作,形成长度为n的字节片段序列。每一个字节片段称为Gram,对所有Gram的出现频度进行统计,并按照事先设定好的阈值进行过滤,形成关键Gram列表,即这个文本的向量特征空间,列表中的每一种Gram就是一个特征向量维度。该模型基于马尔可夫假设,即假设在一段文本中,第n个词的出现只与前面n-1个词相关,与其他任何词都不相关。基于这样的假设,可以评估文本中每一个词出现的概率,整句的概率就是各个词出现概率的乘积。这些概率可以通过直接从语料中统计n个词同时出现的次数得到,常用的有一元的Uni-Gram、二元的Bi-Gram和三元的Tri-Gram。具体来说,它对一个词建模是基于给定的先前n-1个词,即p(wi|wi-1,wi-2,…,wi-n+1),n越大,模型能够捕获的上下文就越长。与之相关的方法是围绕词建立对称窗口模型p(wi|wi+1,wi-1,wi+2,wi-2,…)[1]。
关于建模文档局部性的研究主要集中在n-Gram模型的变体上。文献[2]采用局部加权词袋(Locally Weighted Bag-of-Words,LWBOW)方法来扩展n-Gram,其在长度归一化文档上使用了核平滑,通过在一个文档的每个位置应用不同的权值并总计出靠近特定位置的词出现,扩展了局部依赖关系。该方法采用平滑核在概率单纯形中生成一条平滑曲线,该曲线代表文档的时间推进。……
