文本相似度计算研究进展综述
2019-03-18王寒茹张仰森
北京信息科技大学学报(自然科学版) 2019年1期
王寒茹,张仰森
(北京信息科技大学 计算机学院,北京 100192)
0 引言
文本相似度计算是自然语言处理任务的基石,对后续的文本处理起着非常关键的作用。文本相似度一般指文本在语义上的相似程度,被广泛应用于自然语言处理任务的各个领域。在机器翻译领域,它可以作为翻译精确度的评价准则;在搜索引擎领域,可用于衡量检索文本与被检索文本之间的相似程度;在自动问答领域,可用来评定问题与答案之间的语义匹配度;在抄袭检测领域,通过相似度计算可以检测出两段文本的抄袭程度;在文本聚类方面,相似度阈值可以作为聚类标准;在自动文摘中,相似度可以反映局部信息拟合主题的程度。
根据相似度计算方法的特点,文本相似度可以分为字面匹配相似度、语义相似度和结构相似度。字面相似度一般采用Jaccard距离、最小编辑距离、最长公共子串等基本方法进行文本相似度计算。语义相似度可以从基于统计和基于规则两方面进行考虑;结构相似度计算的关键在于分析文本的句法结构。
1 基于字面匹配的方法
基于字面匹配的相似度算法只是单纯从词形上考虑文本的相似度,认为“形似即义似”。车万翔等[1]采用编辑距离计算相似度,用词语代替单个汉字或字符作为基本编辑单元;俞婷婷等[2]根据k(n-gram窗口的大小)个字符在文本中出现的频率及其所占权重,用Jaccard距离计算2个文本间的相似度;李圣文等[3]利用公共字符串的信息熵评价文本相似度。……
登录APP查看全文
