APP下载

文本相似度计算研究进展综述

2019-03-18王寒茹张仰森

关键词:语义概念文本

王寒茹,张仰森

(北京信息科技大学 计算机学院,北京 100192)

0 引言

文本相似度计算是自然语言处理任务的基石,对后续的文本处理起着非常关键的作用。文本相似度一般指文本在语义上的相似程度,被广泛应用于自然语言处理任务的各个领域。在机器翻译领域,它可以作为翻译精确度的评价准则;在搜索引擎领域,可用于衡量检索文本与被检索文本之间的相似程度;在自动问答领域,可用来评定问题与答案之间的语义匹配度;在抄袭检测领域,通过相似度计算可以检测出两段文本的抄袭程度;在文本聚类方面,相似度阈值可以作为聚类标准;在自动文摘中,相似度可以反映局部信息拟合主题的程度。

根据相似度计算方法的特点,文本相似度可以分为字面匹配相似度、语义相似度和结构相似度。字面相似度一般采用Jaccard距离、最小编辑距离、最长公共子串等基本方法进行文本相似度计算。语义相似度可以从基于统计和基于规则两方面进行考虑;结构相似度计算的关键在于分析文本的句法结构。

1 基于字面匹配的方法

基于字面匹配的相似度算法只是单纯从词形上考虑文本的相似度,认为“形似即义似”。车万翔等[1]采用编辑距离计算相似度,用词语代替单个汉字或字符作为基本编辑单元;俞婷婷等[2]根据k(n-gram窗口的大小)个字符在文本中出现的频率及其所占权重,用Jaccard距离计算2个文本间的相似度;李圣文等[3]利用公共字符串的信息熵评价文本相似度。……

登录APP查看全文

猜你喜欢

语义概念文本
Birdie Cup Coffee丰盛里概念店
语言与语义
幾樣概念店
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
语义分析与汉俄副名组合