APP下载

一种基于字向量和LSTM的句子相似度计算方法

2019-03-21何颖刚王宇

长江大学学报(自科版) 2019年1期
关键词:语义文本方法

何颖刚,王宇

(集美大学诚毅学院, 福建 厦门 361000)

句子相似度度量是自然语言处理技术的基础,可应用于文本摘要、搜索引擎、论文查重、舆情分析、新闻去重、问答系统等业务领域。特别是在文本相似度计算方面,可以有效提高门户网站新闻去重效果。目前,中文句子相似度计算方法总体上可以分为基于统计学方法、基于汉语语义框架分析方法、基于向量空间模型方法和混合方法4类。

基于统计学方法是通过共现词、统计词频等来计算相似度。赵臻等[1]提出通过对句子语义较为重要的名词、动词、关键词等元素的词性、词位置以及词在句子中出现的频度统计量,设计权重计算公式,综合语义相似度和词序相似度,进行语句相似度计算。冯凯等[2]利用2个句子的所有最长公共子串来计算句子的相似度,在含有大量专有名词的问题集上提高了句子相似度准确率。传统相似度计算方法的缺点是受字词差异、错别字、语法错误、语序的影响较大,基于汉语语义框架分析方法是通过引入知网等专业语义资源,利用语义关系和语法成分来进行相似度计算。闫红等[3]在知网的词汇语义基础上,加入词语义原间反义、对义关系、单义原的否定等额外的特征来计算词语的相似度。朱新华等[4]在知网与同义词词林的词语语义相似度计算方法上重新设计权重计算策略,并考虑词语分布统计进行词语语义相似度计算。黄贤英、张金鹏等[5]基于HowNet语义词典进行改进,提出从词项词性角度构建词性向量,并利用词性向量计算短文本相似度。……

登录APP查看全文

猜你喜欢

语义文本方法
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼
认知范畴模糊与语义模糊
如何快速走进文本