多民族语言本体知识库构建技术
2011-06-28赵小兵邱莉榕赵铁军
中文信息学报 2011年4期
赵小兵,邱莉榕,赵铁军
(1. 中央民族大学 信息工程学院,北京 100081;2. 国家语言资源监测与研究中心 少数民族分中心,北京 100081;3. 哈尔滨工业大学 教育部-微软语言语音重点实验室,黑龙江 哈尔滨 150001)
1 前言
我国是一个统一的多民族国家,55个少数民族中的53个民族都有自己的语言文字。这些语言文字与本民族生存发展息息相关。2009年国务院发表《中国的民族政策与各民族共同繁荣发展》白皮书中指出: “为了使少数民族群众共享信息化时代的成果,国家采取各种措施促进少数民族语言文字规范化、标准化和信息处理工作的健康发展。”
本体(Ontology)[1]是对共享概念的正规、明确的表述。本体始于哲学概念,90年代初被引入人工智能后,作为一种能在语义和知识层面上描述信息系统的概念模型建模工具[2]。
基于语义的本体库是实现跨语言信息检索、信息抽取、自动翻译等智能信息处理应用的重要基础,是智能文本信息处理的重要环节。为人们所熟知的本体库中文《知网》HowNet[3],是一个较为完整的以语言知识为基础的中文本体知识库。目前,《知网》已成为许多自然语言智能处理系统的基础资源。
本体构建需要描述语言共性和个性信息。大量的语言研究说明,不同语言除具有个性差异外,还有共性因素。语言共性研究认为,语言间存在某种共同的普遍规律,称为“普遍语法”。为蒙、藏、维、哈、朝等民族语言以及汉语、英语构建统一标准的本体库,对于多民族语言智能信息处理应用将起到积极地推动作用。……
登录APP查看全文
