APP下载

基于时间递归序列模型的短文本语义简化

2019-07-29蔺伟斌杨世瀚

物联网技术 2019年5期

蔺伟斌 杨世瀚

摘 要:针对传统循环神经网络训练算法无法处理梯度消失和梯度爆炸等问题,基于循环神经网络建立LSTM模型和seq2seq模型,提出时间递归序列模型TRSM,处理序列中间隔和延迟相对较长的输入,使用BPTT反向传播算法对中文微博语料库进行训练。建立三组不同的实验作为对比,实验结果表明,TRSM模型处理后的微博文本更加简洁精炼,更适合文本语义的提取,大大减少了计算量,文字缩减率达到60%以上,语义保持率达到1.8,简化了用户要处理的大量信息,处理后的结果能够更好地用于几个关键中文语义的处理任务。

关键词:短文本信息;文本简化;LSTM模型;TRSM模型;BPTT反向传播算法;循环神经网络

中图分类号:TP391 文献标识码:A 文章编号:2095-1302(2019)05-00-06

0 引 言

随着互联网的高速发展,各种互联网信息(如语音信息、图片信息、文本信息等)也呈爆发式增长。人们每天都能接触到大量多样的信息,如来自新闻报导、博客、微博等各个渠道的文本信息。为了对这些海量信息进行快速、高效地分析与处理,使机器准确理解这些信息,经研究发现,基于高语义保持度的文本简化就是一个可行的方法。所以文本简化逐渐成为人们的重要需求之一,也是自然语言处理领域的热点问题。

目前,文本简化的研究方法大致可以分为抽取型和生成型两种类型。自然语言处理领域的研究员用不同的方式从这两种类型中做文本简化。文献[1]采用Hedge Trimmer句子压缩技术对英文语句进行压缩,划分出原句的语法结构,组织成语法树,再应用一定的语法规则修改语法树的一些组成部分。……

登录APP查看全文