基于有序神经元LSTM的短文本相似性检测
2021-12-14吴迎岗
计算机应用与软件 2021年12期
吴 迎 岗
(广东工业大学计算机学院 广东 广州 510006)
0 引 言
随着当今互联网的不断快速发展,以短文本为基本形式的网络信息急剧增加,文本分析应用中短文本相似度计算起了重要作用,文本挖掘、人工智能信息检索和知识管理等都需要借助于文本的相似性检测、度量和评价的方法[1-2]。短文本相似性检测就是通过计算得到两个文本中这些相似部分的比例,然后分析及整合中间结果的过程。如果两者相似度超过某一阈值,则可以判断内容重复,并将结果反馈给用户,对于存储方面也能够有效地降低存储消耗。目前,常用的短文本相似度算法有基于关键词频率和反向文本频率计算相似度的方法(TF-IDF)[3]、空间余弦相似度算法[4]、传统的基于精确匹配的相似性匹配算法[5]、基于距离测量的差分对齐算法[6]等。
伴随着深度学习在自然语言处理方面的迅速发展,其在文本相似度任务中也被逐渐地应用起来,并不断取得新的突破。本文在已有神经网络研究的基础之上,提出一种更加简单有效的基于有序神经元LSTM(ON-LSTM)相结合的短文本相似度计算的方法。该模型能够更好地对短文本深层次的结构信息以及对词汇间的局部语义信息进行关注和表达,并经过IC层,加快模型的收敛速度。最终结合整体的语义信息表示,来计算文本的语义相似度,并判断是否是相同的语义表达。
1 相关理论
1.1 词向量
在如今的自然语言处理中词嵌入技术得到了广泛应用,它是将单词词语用矢量的形式进行表达并得到计算机能够识别的向量形式的技术,在短文本处理任务中为文本量化。……
登录APP查看全文
