词语相似度算法研究综述
2015-09-08李慧
现代情报 2015年4期
李慧

[摘要]词语相似度计算方法在信息检索、词义消歧、机器翻译等自然语言处理领域有着广泛的应用。现有的词语相似度算法主要分为基于统计和基于语义资源两类方法,前者是从大规模的语料中统计与词语共现的上下文信息以计算其相似度,而后者利用人工构建的语义词典或语义网络计算相似度。本文比较分析了两类词语相似度算法,重点介绍了基于Web语料库和基于雏基百科的算法,并总结了各自的特点和不足之处。最后提出,在信息技术的影响下,基于维基百科和基于混合技术的词语相似度算法以及关联数据驱动的相似性计算具有潜在的发展趋势。
[关键词]词语相似度;语义资源;语料库;维基百科;WordNet
[中图分类号]TP18
[文献标识码]A
[文章编号]1008-0821(2015)04-0172-06
词语之间的语义相似性研究是自然语言处理以及人工智能领域的基础性研究,如搜索、聚类以及歧义消除等,需要依赖于包含现实世界概念与关系的范围广泛的知识组织体系。自然语言的词语之间有着非常复杂的关系,如上下位关系、同义关系、反义关系等。词语相似度是对词语间复杂关系的数量化,是词语间语义相似紧密程度的一种定量度量。目前,词语相似度的研究可以分为两类,一类是基于语料库的算法,通过统计大规模语料库,根据词语间信息量或者词语共现频率来计算词语相似度。利用统计技术计算词语间语义相似度是一种无监督的机器学习方法。第二类是基于语义资源的算法,也可被称为基于本体的词语相似度算法,主要根据手工建立的语义网络,通过计算词语间距离得到词语相似度。……
登录APP查看全文
