基于二元文法模型的汉语句子相似度计算
2016-08-01郜炎峰王硕宁
中国科技信息 2016年13期
郜炎峰 王硕宁
基于二元文法模型的汉语句子相似度计算
郜炎峰1王硕宁2
1.哈尔滨商业大学计算机与信息工程学院;2.黑龙江旅游职业技术学院郜炎峰(1990-)男,硕士研究生,研究方向:自然语言处理。


行业曲线

本文针对汉语句子相似度计算准确率低的问题,提出解决方案。在自然语言处理领域起到至关重要的作用。
如付诸现实将产生可观的经济效益。
创新点:1.在关系向量模型的基础上,加入了长句子的影响因素,使关键词的相似度计算更加准确;2.采用更加合理的句长相似度计算公式,使句长对句子相似度的影响更加合理。
随着信息技术的飞速发展,自然语言处理越来越受到人们的重视,句子相似度计算在自然语言处理领域具有非常重要的地位。基于二元文法模型的汉语句子相似度计算方法以相邻关键词共同出现进行加权的方式计算句子相似度。方法重点考虑关键词词形和句长相似度,还适当考虑了近义词的情况。实验结果表明,该方法可以更好的处理句子长度差较大的句子相似度,在计算汉语句子相似度时准确率高于关系向量模型的方法。
在信息技术迅速发展的今天,信息科技迅速融入各个行业,中国网民数量和网络规模也出现了爆炸性的增长,互联网每天都会有海量的信息产生,这些信息以文本、语音、图片等形式被保存下来,其中文本数据信息占据了三分之二。面对海量的数据,如何从中获取有效信息是自然语言处理的重要使命,汉语句子相似度计算作为自然语言处理的一个热点和难点,在自然语言处理中扮演重要的角色。……
登录APP查看全文
