融合语言特征的反讽文本识别模型研究*
2021-01-26白晓雷霍瑞雪
通信技术 2021年1期
白晓雷,霍瑞雪
(国家计算机网络与信息安全管理中心河北分中心,河北 石家庄 050000)
0 引言
近年来,随着自媒体的迅速发展,微博等自媒体平台每日产生了大量网民发布的信息及其评论,对其进行情感分析具有极高的价值。目前,反讽识别的研究还主要集中在英文短文本方面,而中文的反讽识别研究仍处于探索阶段,且目前常见的微博文本情感分析主要用于区分积极、中性以及消极等,对于反讽这一特殊修辞手法的研究相对较少,而实际上反讽语句在全部微博文本中已经占有一定的比例。因此,本文基于微博数据对中文反讽识别进行研究。
1 反讽识别研究现状
国外Burfot 等研究人员主要通过使用词袋法来进行反讽识别。Konstantin 等研究人员[1]在各种分类模型下结合各种反讽特征进行研究,实验结果表明人工选取的特征在提高准确率的同时降低了召回率,加入词袋模型问题得到解决。国内山西大学卢欣等研究人员[2]基于深度学习的方法对中文反讽识别进行了研究。
2 微博反讽语言特征分析
通过对微博常见反讽语言进行汇总和分析,本文提炼了微博反讽语言的主要特征。
(1)固定搭配,如“很好……又”,例子“很好,又拒绝了一个”。
(2)特定副词,如“真有你们的”,例子“想了半天,都懒得骂了,只能说真行,真有你们的,不愧是你们”。
(3)特定的语气词,如“呵呵”等,例子“雪梨直播间卖的卫衣是假货,还删评论,呵呵,网销第一是这样来的”。
(4)网络梗。微博的用户以年轻人为主,含有大量年轻人熟知的网络梗,如“他一直是可以的”等。
登录APP查看全文
