基于分布式ElasticSearch相似内容比对算法研究*
2021-01-19马智勤廖雪花肖文超
计算机与数字工程 2020年12期
关键词:文本
马智勤 廖雪花 邓 威 肖文超
(1.四川师范大学计算机科学学院 成都 610001)(2.四川师范大学物理与电子工程学院 成都 610001)
1 引言
随着信息时代的到来,信息技术也随之迅速发展,文本数据作为最重要的信息载体在信息技术的发展中起到至关重要的作用,同时文本相似度计算作为信息处理领域的一个重要分支,在很多信息处理应用中起着至关重要的作用,其中相似内容比对作为文本信息处理领域的一项关键性技术,广泛应用于智能问答、论文查重、内容检索、自然语言处理等多种信息任务的研究处理中[1]。近年来,文本相似度在推荐系统、信息推送、智能问答等热门领域中备受关注,引起了极大的研究[2]。
目前,文本相似度计算主要分为三类,第一类是基于语料库,如利用词向量基于词袋模型计算相似度的VSM等[3];第二类是基于字符串的计算方法,如余弦相似度计算算法[4];第三类是基于神经网络的深度学习方法,如基于语义深度学习的匹配模型DSSM[5]。
在现有的大多数文本比对算法中考虑单一文本特性进行相似度计算。石彩霞等[6]提出多重检验加权的短文本相似度计算方法;郑志蕴等[7]提出了基于短文本相似度计算的知识子图融合方法;吴浩等[8]提出了融合性特征的中文句子相似度计算方法;邓涵等[9]从句子结构角度对句法和依存关系进行分析计算;卢佳伟等[10]提出融合TextRank算法的中文短文本相似度计算;均未考虑到日益新增的网络新词和流行词对词项识别带来的影响,同时段落替换,词序替换对文本比对的影响未有效解决。……
登录APP查看全文
