基于语义与情感的句子相似度计算方法
2021-08-19杨延娇赵国涛王丕栋
计算机工程与应用 2021年16期
杨延娇,赵国涛,王丕栋
西北师范大学 计算机科学与工程学院,兰州730070
句子相似度计算是自然语言处理中一项重要的基础性研究,相关研究成果可以广泛应用到许多方面。在智能问答系统中,使用句子相似度从原始数据库中找出与目标句子最相似的句子[1];在机器翻译中,使用句子相似度从实例集中找出与待翻译语句最相似的源语句[2];在文本自动分类中,使用句子相似度作为判别构成文本的句子集归类的主要标准[3];在文本检测和文本查重中,句子相似度计算作为核心标准,决定了文本检测和查重的准确率[4]。因此,句子相似度是一项重要的计算标准,其计算效率和准确率可影响到许多相关系统的运行效率。
目前国外成熟的句子相似度计算方法有简单匹配、最长公共子序列(Longest Common Length,LCS)、莱文斯坦距离(Levenshtein Distance)、Jaccard等[5]。不同于印欧语言以单词为语义的最小单位,中文因为其构词表意的灵活性,使得上述方法应用于中文句子相似度计算时,只考虑到了词语的字面信息与句子相互转化的次数等特征,而忽略了词语的语义信息和操作可能引起的语义差异,导致此类方法对中文句子相似度计算准确率较低。
在此基础上,Ruan等[6]使用词嵌入技术,结合Word2vec与神经网络来计算句子相似度,这种方法考虑到了句子形态信息,但未考虑到句子语义信息。Gokul等[7]使用句子中关键词的同义词,结合余弦相似度在喜马拉雅语中查找相似短语,取得了不错的效果,但该方法适用于特定语言,通用性小。……
登录APP查看全文
