中文短幽默文本的识别研究*
2021-10-26谭红叶陈浩然
山西电子技术 2021年5期
何 苑,谭红叶,陈浩然
(1.长治学院计算机系,山西 长治 046011;2. 山西大学计算机与信息技术学院,山西 太原 030006)
0 引言
幽默在自然语言理解领域一直是一项充满趣味但又棘手的研究。近几年,计算机所扮演的角色不断地转换,从只能执行指定任务的自动机,慢慢转变为可以与人动态交互、理解用户的智能机器。幽默识别是指给定一段文本,判断该文本在一定程度上是否产生幽默的效果[1]。幽默识别在自然语言领域中是一项困难的任务。第一,对于幽默我们很难得到一个统一的定义。第二,幽默效果的产生往往需要依赖一些外部知识。例如,“海鸥飞到巴黎都不叫了,因为巴黎鸥来哑。”。如果我们不知道谐音梗的话,我们就会认为没有产生幽默。
1 相关工作
现在大多数研究将幽默识别问题看做是一个二分类问题,通过一系列语言上的特征来实现幽默识别[2]。除了语言上的特征,其他方面的研究包括口语的声韵律以及多模态特征等。与幽默识别相比,幽默生成的大多数研究工作都是基于幽默理论去解释产生幽默的因素,然后运用模板去生成笑话[3]。借鉴关于幽默锚点的工作[4],我们基于中文短文本的特点,收集了大量的正样例和负样例来训练分类器,并挑选出一部分作为测试集,检验分类模型的效果。我们基于两种特征构建分类模型:1)基于幽默锚点的结构特征,2)基于文本内容特征。
2 数据准备
为了能够实现幽默识别,我们构建了包含幽默和非幽默样例的正负样例数据集,训练幽默识别模型和检测模型的识别效果。……
登录APP查看全文
