APP下载

融合语言特征的反讽文本识别模型研究*

2021-01-26白晓雷霍瑞雪

通信技术 2021年1期
关键词:分类特征文本

白晓雷,霍瑞雪

(国家计算机网络与信息安全管理中心河北分中心,河北 石家庄 050000)

0 引言

近年来,随着自媒体的迅速发展,微博等自媒体平台每日产生了大量网民发布的信息及其评论,对其进行情感分析具有极高的价值。目前,反讽识别的研究还主要集中在英文短文本方面,而中文的反讽识别研究仍处于探索阶段,且目前常见的微博文本情感分析主要用于区分积极、中性以及消极等,对于反讽这一特殊修辞手法的研究相对较少,而实际上反讽语句在全部微博文本中已经占有一定的比例。因此,本文基于微博数据对中文反讽识别进行研究。

1 反讽识别研究现状

国外Burfot 等研究人员主要通过使用词袋法来进行反讽识别。Konstantin 等研究人员[1]在各种分类模型下结合各种反讽特征进行研究,实验结果表明人工选取的特征在提高准确率的同时降低了召回率,加入词袋模型问题得到解决。国内山西大学卢欣等研究人员[2]基于深度学习的方法对中文反讽识别进行了研究。

2 微博反讽语言特征分析

通过对微博常见反讽语言进行汇总和分析,本文提炼了微博反讽语言的主要特征。

(1)固定搭配,如“很好……又”,例子“很好,又拒绝了一个”。

(2)特定副词,如“真有你们的”,例子“想了半天,都懒得骂了,只能说真行,真有你们的,不愧是你们”。

(3)特定的语气词,如“呵呵”等,例子“雪梨直播间卖的卫衣是假货,还删评论,呵呵,网销第一是这样来的”。

(4)网络梗。微博的用户以年轻人为主,含有大量年轻人熟知的网络梗,如“他一直是可以的”等。

登录APP查看全文

猜你喜欢

分类特征文本
分类算一算
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征