APP下载

基于LSTM的谣言检测

2021-08-23刘钟山

现代计算机 2021年20期
关键词:分类特征文本

刘钟山

(天津工业大学计算机科学与技术学院,天津300387)

0 引言

中国互联网络中心(CNNIC)于2020年9月发布的《中国互联网络发展状况统计报告》显示,截至2020年6月,我国网民规模为9.40亿,较2020年3月新增网民3625万,互联网普及率达67.0%,较2020年3月提升2.5个百分点。其中,50岁及以上万民群体占比由2020年3月的16.9%提升至22.8%,互联网向中高年龄人群渗透的趋势愈发明显。

移动互联网使人们获取信息更加方便快捷,但网络中存在的谣言对公众产生了较大的影响。雷霞将谣言定义为:没有相应事实基础却被捏造出来并通过一定手段推动传播的言论。文献[1]特别对于识别信息能力较差的老年用户,谣言使他们不能获得正确的信息,阻挡了他们了解社会动态,谣言的传播也对社会稳定造成了不利影响。2020年12月,诸如“成都确诊女孩照片”、“武昌职业学院士官生集体发烧”等谣言混淆公众视听,对社会影响十分恶劣。

1 相关文献综述

传统方法的谣言检测通常基于文本的转发量、评论量、发布用户的注册时间、粉丝数等统计特征并结合SVM、机器学习等方法进行识别。

2013年,贺刚等人[2]将谣言识别视为可信性分类问题,引入识别谣言的符号特征、链接特征、关键词分布特征和时间差等新特征并基于SVM机器学习方法来预测是否为谣言;

2013年,程亮等人[3]通过微博谣言的传播特点和产生原因,利用BP神经网络模型及改进其激发函数并引入冲量项,对微博话题在传播过程中演变为谣言进行检测;

2016年,毛二松等人[4]提出了一种基于深层特征和集成分类器的微博谣言检测方法,首先对微博情感倾向性、微博传播过程和微博用户历史信息进行特征提取并利用训练的集成分类器进行分类;……

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征