基于特征序列的语义分类体系的自动构建
2015-04-21陈刚,刘扬
中文信息学报 2015年3期
陈 刚,刘 扬
(1. 北京大学 计算语言学研究所,北京 100871;2. 北京大学 计算语言学教育部重点实验室,北京 100871)
基于特征序列的语义分类体系的自动构建
陈 刚1,2,刘 扬1,2
(1. 北京大学 计算语言学研究所,北京 100871;2. 北京大学 计算语言学教育部重点实验室,北京 100871)
词义知识表示主要依赖属性描述或分类描述,这两种方式各有所长,但不同表示之间相互转换的可行性与现实状况还未被关注。在属性描述的基础上,该文引入序关系的思想,提出基于特征序列的概念与方法,以此来模拟、分析概念涵义从一般到特殊的渐次生成过程,发掘尚未显性化的中间概念,自动构建出一个语义分类体系。以HowNet(2000版)数据为例,实验表明该方法可以生成一个性质优良、覆盖完全的新的语义分类体系,并反映此前的属性描述在语言知识工程实践中不易察觉的一些问题。
词义知识;属性描述;分类描述;序关系;特征序列;语义分类体系
1 引言
本体(Ontology)是一种形式化的、可共享的概念模型,它能够在知识层面上为一般或特定领域的概念及其关系提供明确的描述,实现对相关领域知识的共同理解和共享复用[1-2]。词义知识库作为一种特定本体,关注的是语言系统内部的词汇语义以及它们之间的相互关系,其知识表示方式主要有两种: 属性描述和分类描述。
词义知识的属性描述一般采取构造方式,借助义素分析等方法预先定义出一组基本语义单位,然后按照一定的描写规则将这些基本语义单位组合起来,形成针对特定词义的相互独立的概念描写,使用这种方法的典型系统是HowNet[3]等;……
登录APP查看全文
