基于深度学习的中文零代词识别
2021-02-22王立凯曲维光魏庭新周俊生顾彦慧
南京师范大学学报(工程技术版) 2021年4期
王立凯,曲维光,,魏庭新,周俊生,顾彦慧,李 斌
(1.南京师范大学计算机与电子信息学院,江苏 南京 210023) (2.南京师范大学文学院,江苏 南京 210097) (3.南京师范大学国际文化教育学院,江苏 南京 210097)
零指代是语言学中一种特殊的语言现象,是指为了保证语言的连贯性而省略的、且可通过上下文推断出的语言单元. 该省略的语言单元在句子中承担相应的句法成分,可以和前文中一个或多个名词短语等语言单元构成指代关系. 这种被省略的语言单元称为零代词,前文中与其构成指代关系的语言单元被称为先行语.
例句1虽然[卓伟]的新闻装备落后,但Ф1说起娱乐新闻观念,Ф2却比许多年轻同事更自由,更激进.
例句1中,Ф2就是一个零代词,指向前文中的人名“卓伟”. 但Ф1就不是一个零代词,前文中没有语言单元与其构成指代关系. 因此,零代词的两个必要条件是:(1)句中存在句法成分缺省;(2)前文中有语言单元与其构成指代关系. 与英文相比,汉语是一种意合型语言,其特点是形态不完整,这使得汉语中存在大量的缺省. 据Kim[1]统计,汉语中存在句法成分省略的现象高达36%,而英文中的省略现象则不超过4%,所以零指代的识别与消解对于中文信息处理来说显得更加迫切和重要.
中文零指代通常可分为两个子任务,一是零代词的识别,二是零代词的消解. 目前的研究工作多数聚焦于消解部分,并取得了丰硕成果[2-4],而零代词的识别研究相对较少. 零代词识别是指识别出句子……
登录APP查看全文
