中文篇章零元素语料库构建
2019-01-29盛晨孔芳周国栋
北京大学学报(自然科学版) 2019年1期
关键词:语义
盛晨 孔芳 周国栋
苏州大学计算机科学与技术学院自然语言处理实验室, 苏州 215006; † 通信作者, E-mail: kongfang@suda.edu.cn
随着人工智能如火如荼地发展, 为实现无障碍人机智能交互的终极目标, 自然语言处理作为其至关重要的分支, 承担起语言理解的重任[1]。省略作为一种常见现象广泛存在于汉语表述, 其省略成分称为零元素(zero pronoun)。准确识别出该零元素并理解作者的真实意图, 是自然语言处理面临的重大挑战任务之一。
到目前为止, 尽管这些有关中文零元素的研究已取得一定的成果, 但其效果仍不尽如人意。首先,汉语的复杂性决定了该任务的难度, 大量的长句以及复杂的句法带来巨大的挑战。此外, 语料资源的稀缺也是限制中文零元素发展的重要原因之一。
本文针对上述问题, 基于篇章理解层面, 对中文省略现象进行深入的探究, 提出篇章零元素的概念。在此基础上, 完成中文篇章零元素语料库构建,并进行语料库相关的统计分析。
1 相关工作
近年来, 中文零元素现象备受关注, 针对中文的零元素识别与消解任务取得一系列的研究成果。然而, 这些研究主要侧重于方法, 对语料库的构建则考虑较少。
Zhao 等[2]给出一个完整的基于机器学习的中文零指代识别及消解方案, 并提出一套有效的特征集合。Yang 等[3]基于 CTB 语料对零元素识别进行研究, 采用序列化标注模型来识别句中存在的零元素。Kong 等[4]给出一个基于树核函数的中文零元素消解的完整框架, 将中文零指代消解任务清晰地划分成 3 个子任务: 零元素识别、待消解项识别和零元素消解, 分别给出每一个子任务适用的结构化特征集。……
登录APP查看全文