融合微博语言特征的CNN 反讽文本识别模型研究*
2021-05-20白晓雷霍瑞雪
通信技术 2021年5期
白晓雷,霍瑞雪
(国家计算机网络与信息安全管理中心河北分中心,河北 石家庄 050000)
0 引言
目前,微博作为一个典型的自媒体社交工具,其每天会产生海量的话题与评论。如何利用自动化方法对其进行情感判定并提高准确率成为一个重要问题,尤其是针对反讽这一特殊的情感类别。笔者在前期工作中使用了融合微博语言特征的词袋模型进行训练,但仍存在准确率、召回率不高的问题。因此,本文在前期工作的基础上,基于微博数据采用融合微博融合语言特征的卷积神经网络模型对中文反讽识别进行了研究。
1 反讽识别研究现状
Konstantin 等研究人员[1]基于英文语料在各种分类模型下结合各种反讽特征进行研究,发现人工选取的特征提高了反讽识别准确率。Aniruddha Ghosh[2]等研究人员率先基于英文语料采用卷积神经网络(Convolutional Neural Networks,CNN)和长短期记忆人工神经网络(Long Short-Term Memory,LSTM)来识别反讽,并得出深度学习方法优于传统机器学习方法的结论。国内山西大学卢欣等研究人员使用深度学习的方法对中文反讽识别进行了研究[3],但实验结果依然存在准确率等指标不高的问题。
2 微博反讽语言特征分析
本文在收集和分析海量微博反讽语句后,得出了主要4 种类型的语言特征[4]。
(1)固定搭配,如“再……一点”,例子“重庆可以再湿一点吗?我的衣服晾了两天一件都没干”。
(2)特定副词,如“真有你的”,例子“欠钱逾期不还,找你要还这种态度,真有你的”。
(3)特定的语气词,如“呵呵”等,例子“呵呵,你竟然是这种人”。
登录APP查看全文
