APP下载

中文篇章零元素语料库构建

2019-01-29盛晨孔芳周国栋

北京大学学报(自然科学版) 2019年1期
关键词:语义

盛晨 孔芳 周国栋

苏州大学计算机科学与技术学院自然语言处理实验室, 苏州 215006; † 通信作者, E-mail: kongfang@suda.edu.cn

随着人工智能如火如荼地发展, 为实现无障碍人机智能交互的终极目标, 自然语言处理作为其至关重要的分支, 承担起语言理解的重任[1]。省略作为一种常见现象广泛存在于汉语表述, 其省略成分称为零元素(zero pronoun)。准确识别出该零元素并理解作者的真实意图, 是自然语言处理面临的重大挑战任务之一。

到目前为止, 尽管这些有关中文零元素的研究已取得一定的成果, 但其效果仍不尽如人意。首先,汉语的复杂性决定了该任务的难度, 大量的长句以及复杂的句法带来巨大的挑战。此外, 语料资源的稀缺也是限制中文零元素发展的重要原因之一。

本文针对上述问题, 基于篇章理解层面, 对中文省略现象进行深入的探究, 提出篇章零元素的概念。在此基础上, 完成中文篇章零元素语料库构建,并进行语料库相关的统计分析。

1 相关工作

近年来, 中文零元素现象备受关注, 针对中文的零元素识别与消解任务取得一系列的研究成果。然而, 这些研究主要侧重于方法, 对语料库的构建则考虑较少。

Zhao 等[2]给出一个完整的基于机器学习的中文零指代识别及消解方案, 并提出一套有效的特征集合。Yang 等[3]基于 CTB 语料对零元素识别进行研究, 采用序列化标注模型来识别句中存在的零元素。Kong 等[4]给出一个基于树核函数的中文零元素消解的完整框架, 将中文零指代消解任务清晰地划分成 3 个子任务: 零元素识别、待消解项识别和零元素消解, 分别给出每一个子任务适用的结构化特征集。……

登录APP查看全文

猜你喜欢

语义
为什么字看久了就不认识了
语言与语义
“社会”一词的语义流动与新陈代谢
“上”与“下”语义的不对称性及其认知阐释
“吃+NP”的语义生成机制研究
“V+了+NP1+NP2”中V的语义指向简谈
认知范畴模糊与语义模糊
“V+X+算+X”构式的语义功能及语义网络——兼及与“V+X+是+X”构式的转换
“熊孩子”语义新探
“深+N季”组配的认知语义分析