基于词模式嵌入的词语上下位关系分类
2019-01-29孙佳伟李正华陈文亮张民
北京大学学报(自然科学版) 2019年1期
孙佳伟 李正华 陈文亮 张民
苏州大学计算机科学与技术学院, 苏州 215006; † 通信作者, E-mail: zhli13@suda.edu.cn
语料库是自然语言处理任务的重要数据资源之一。上下位关系是部分语料库的基本框架, 如WordNet 和 HowNet。这些由人工构造的语料资源准确、清晰, 是进行文本、语言研究的主要数据来源。然而, 大型的语料库资源具有明显的缺点: 1)维护和更新需要耗费大量的人力资源; 2)语料库的范围和领域都非常狭小和固定[1]。因此, 迫切需要研究能够自动获取上下位关系的方法。
上下位关系分类(hypernym relation classification)是对给定的名词词语对<x,y>进行自动分类的自然语言处理技术。比如, 将词语对<狗, 动物>判断为具有上下位关系的词对, 判断<花朵, 蜜蜂>不具有上下位关系。上下位关系分类不仅能够支持更高层次的自然语言处理任务, 如句法分析以及抽象语义表示, 而且在信息处理领域也有广泛的应用价值, 如在语料的属性词层次构建中, 可用于判断层次关系。
本文研究基于汉语的上下位关系分类方法, 并提出一种新的词模式, 构建融合词模型。研究目标在于提高基于模式方法的召回率, 降低模式匹配的难度。在融合词模型中, 词模式更容易匹配, 能够在短语模式基础上大幅度地提高基于模式方法的召回率, 从而提高关系分类的 F1 值。在词模式保留上下文信息的基础上, 本文还结合词嵌入的语义信息, 构建词模式嵌入模型。目前, 尚没有公开的、大型的中文上下位数据库。本文提出上下位关系数据构建方法, 数据构建主要根据同义词词林与NLPCC-2017 测评数据, 添加部分人工构建工作。……
登录APP查看全文