隐马尔科夫模型对于文本数据处理的应用
2017-07-13侯垚国防大学政治学院军事信息与网络舆论系
消费导刊 2017年19期
关键词:模型
侯垚 国防大学政治学院军事信息与网络舆论系
隐马尔科夫模型对于文本数据处理的应用
侯垚 国防大学政治学院军事信息与网络舆论系
一阶隐马尔科夫模型有两个假设:①马尔科夫假设,即某特定状态只与其前一个状态有关;②输出独立性假设,一个输出某观察值的概率只与产生该观察值的状态有关,而与其他任何状态和任何观察值无关。
马尔科夫模型 文本数据处理
一、词语切分的应用
运用马尔科夫模型在中文分词中时,需要确定模型的参数值具体指代什么含义。文献[1]指出,在汉语词性标注时,可以将输入词的序列作为观测值序列,将词性序列作为状态转移序列,该问题可以转化为,已知词语的字符串,求出最优的词性标注序列(解码问题)。在参数的训练中,初始状态的概率分布矩阵可以用统计的方法求得,而状态转移矩阵可用词性转移次数与词性出现总数的比值求得,发射概率矩阵也可用输出词频数与词性频数的比值来确定。对于一个分词模型来说其设计思路流程大体分为如下几步[2]:
①带切分句子;②生成解的空间集合(即候选的切分集);③在解空间中求最优解(解决切分歧义);④切分结果。
文献[2]分析了基于中文分词的一阶隐马尔科夫模型和在生语料库中的算法,并建立了基于HMM模型进行中文分词的仿真系统。文献[3]在进行词语切分时对HMM进行改进,将经过初步切分的兼类词串和未登录词串的词汇单独抽取出来,利用Viterbi算法求得某一词串的最大概率。……
登录APP查看全文
