基于词信息嵌入的汉语构词结构识别研究
2022-06-21殷雅琦代达劢
中文信息学报 2022年5期
郑 婳,刘 扬,殷雅琦 ,王 悦,代达劢
(1. 北京大学 计算机学院,北京 100871;2. 北京大学 计算语言学教育部重点实验室,北京 100871)
0 引言
汉语构词结构的研究由来已久,从《马氏文通》[1]开始,涉及语法、词汇学的论著大都关注构词的话题,该问题对汉语语言学的重要性不言而喻。赵元任[2]、朱德熙[3]等学者指出,词的结构是影响词义的一个重要因素。谭景春[4]、曹炜[5]等深入分析了汉语词在结构组配过程中的意义和贡献。苏宝荣[6]进一步指出结构能够从句法、词法和新词义生成三个层面对语言产生影响。
面向中文信息处理的需求,杨梅[7]给出了一套较为完善的构词结构标签,并证明了采用构词进行计算处理的可操作性和优越性。吉志薇和冯敏萱[8]、田元贺和刘扬[9]尝试利用语素信息和构词规则实现对未登录词的理解和语义预测。陈龙等[10]则以语素概念和构词结构为基础,实现了对具有隐喻和转喻现象的汉语非字面义词的表示和理解。Zheng等[11-12]在语义生成和词义消歧任务中融入了构词结构信息,并取得了良好的效果。
认识到汉语构词结构在理论和应用上的重要性,信息处理领域的学者开始关注构词结构的自动识别,但是迄今为止开展的计算性工作依然较少: 在已有的研究中,Li[13]以句法结构标签表示对构词结构进行识别,Zhang等[14]利用四种常见构词结构帮助识别复合词的主体部分,孙静等[15]根据前缀与后缀结构构建计算模型。这类计算中大多沿用句法层面的粗粒度标签,缺乏相对明晰的语言学分类标准;……
登录APP查看全文
