一种基于依存句法和WRD 的句子相似计算方法*
2021-01-26石元兵金贵涛
通信技术 2021年1期
周 俊,石元兵,魏 忠,金贵涛,郭 红
(卫士通信息产业股份有限公司,四川 成都 610041)
0 引言
在自然语言处理技术中,句子相似度计算是一项重要的基础研究技术,被广泛应用于很多领域。比如,在信息检索领域中,可以使用句子相似计算技术计算输入查询句的相似检索句子,从而得到更准确的检索结果;在敏感数据检测领域,可以使用句子相似计算技术来检测目标文档的句子与指定敏感句是否相似,从而判断目标文档是否是敏感文档。因此,句子相似计算技术的发展与很多领域的技术应用密切相关,成为自然语言处理技术中的一个研究重点。
目前,主要的句子相似计算技术可以分为以下几类。
(1)基于统计的相似度计算[1],即对两个句子的字、词语、短语等不同成分维度的不同特征(如字频、词频、TF-IDF[2]等)进行统计,统计结果越相近表示两个句子越相似。这种方法的弱点是没有考虑语义维度上的相似性。
(2)基于语义词典的相似度计算[3]。因为语义词典(如同义词词林、知网等)能够表征两个词语之间的语义相似关系,所以可以使用语义词典(如同义词词林、知网等)检测两个句子的语义相似词语。语义相似词语越多,表示这两个句子越相似。这种方法的弱点是语义相似词典的词语太少,无法满足层出不穷的新词语。
(3)基于向量空间模型的相似度计算,即把句子转化为向量来表示,从而使两个句子的相似计算转变为对应的两个向量的距离计算。常用的向量模型有VSM、LSA、Word2vec 等[4]。……
登录APP查看全文
