基于对抗学习的讽刺识别研究
2019-01-29张庆林杜嘉晨徐睿峰
北京大学学报(自然科学版) 2019年1期
张庆林 杜嘉晨 徐睿峰
哈尔滨工业大学(深圳)计算机科学与技术学院, 深圳 518055; † 通信作者, E-mail: xuruifeng@hit.edu.cn
近年来, 随着讽刺在微博、论坛等互联网应用中的广泛使用以及文本情感分析问题的深入研究,越来越多的学者对讽刺识别产生浓厚兴趣。由于用户在使用讽刺表达情感时, 往往出现想表达的情感倾向与字面相反的情况, 所以对讽刺表达的判别会明显影响面向社交媒体的文本情感分析性能。因此, 讽刺识别问题的深入研究对提高文本情感分析系统、问答系统以及会话机器人等自然语言处理应用的性能具有重要意义。
讽刺识别的传统方法主要依靠人工构建特征模板和规则[1-2], 需要依赖领域专家, 且耗费大量的时间和精力, 同时规则系统的可迁移性也比较差。随着深度学习模型在众多自然语言处理问题上取得重大突破, 有学者将其引入讽刺识别任务中[3-4]。但是, 目前讽刺识别领域只有少量公开的人工标注数据或利用弱监督方式自动标注的数据, 缺乏大规模、高质量的讽刺标注语料, 导致基于机器学习(特别是深度学习)的讽刺识别模型的性能受到一定的限制。
本文提出一种在使用少量标注训练数据的情况下, 应用对抗学习框架[5]来提升深度学习模型在讽刺识别任务中性能的方法。首先, 在将注意力卷积神经网络[6-8]模型应用于讽刺识别的基础上, 采用两种对抗学习方法来提高讽刺识别的性能。其中,基于对抗样本的学习方法[9]在模型训练过程中定向地生成面向识别模型的攻击样本, 用于模型训练,以期增强模型的鲁棒性和泛化性能。……
登录APP查看全文