基于知网与搜索引擎的词汇语义相似度计算
2018-05-09吴克介王家伟
计算机与现代化 2018年4期
吴克介,王家伟
(重庆交通大学信息科学与工程学院,重庆 400074)
0 引 言
词汇语义相似度的计算广泛应用于信息检索、词义消歧、数据融合、机器翻译等领域。目前,词汇语义相似度的计算方法主要分为2类:基于知网的方法和基于搜索引擎的方法。
知网(HowNet)[1-2]是以揭示概念与概念之间所具有的属性之间的关系为基本内容的常识知识库。自知网诞生以来,许多研究者利用知网计算词汇语义相似度[3-9]。刘群等人[7]采用义原间的距离完成词汇语义相似度的计算。李峰等人[8]在刘群和李素建工作的基础上考虑了义原的层次关系,优化了义原的相似度计算。魏韡等人[9]综合考虑义原的信息量和所在义原树的深度及结构特征,提出基于义原在义原树的深度信息量及路径的混合方法来计算义原相似度。
基于搜索引擎的词汇语义相似度计算能够适应于层出不穷的新词汇,受到许多研究者的关注[10-13]。高国强等人[10]利用搜索结果数扩展逐点共有信息(PMI)算法为WebPMI,对于相关性较强的词汇采用双重检测算法(CODC)计算相似度,否则使用WebPMI计算。陈海燕[11]利用搜索引擎检索的语义片段和结果的页数来去除词汇语义相似度计算过程中的噪音和冗余,通过整合查询结果页数、语义片段和重复记录数完成词汇语义相似度计算。张硕望等人[12]利用词语与义原之间的包含关系优化基于知网的词汇语义相似度计算,将PMI算法与CODC算法应用于百度搜索引擎,优化基于搜索引擎的语义相似度计算,利用批量梯度下降法学习权值参数,融合知网与搜索引擎完成词汇语义相似度计算。……
登录APP查看全文
