融合词向量的多特征问句相似度计算方法研究
2017-08-10曹莉丽王未央
现代计算机 2017年17期
曹莉丽,王未央
(上海海事大学信息工程学院,上海 201306)
融合词向量的多特征问句相似度计算方法研究
曹莉丽,王未央
(上海海事大学信息工程学院,上海 201306)
问句的相似度计算是自动问答系统的关键部分,而现有的计算模型准确率较低。为此,应用Word2vec建立带有语义的词的向量表示,提出一种利用词向量距离,结合词项权重、句子长度等因素的问句相似度计算方法。该方法综合考察两个句子的语义信息,句法信息,词的表层信息来测量问句的相似度。实验部分设计四种问句相似度计算方法,结果表明该方法提高相似度计算的准确率。
词向量;依存关系;问句相似度;词项权重
0 引言
常见的句子相似度算法有基于关键词表层信息、基于句法信息以及基于语义信息等的计算模型[1-2]。基于关键词表层信息的方法,考虑了词形、句长、词序等信息,但该方法没有考虑语义、句法信息。同时在关键词抽取过程中把动词、名词、形容词等实词作为关键词[3],忽略了句法上相连词项间的关联信息以及句子整体的结构信息。基于句法分析的方法,按依存关系的有效配对计算相似度[4-5],但该方法缺乏语义信息,无法表达语义层面的相似性。基于语义信息的方法,主要有基于《知网》等语义字典的句子相似度计算方法[6-7]。然而该方法需要领域的专家来完善和扩展部分词语。针对上述情况,本文提出了一种基于词向量,结合依存路径信息构建的词项权重以及句长等因素的问句相似度计算方法。……
登录APP查看全文
