基于HNC的汉语词语知识库改进
2012-06-29王青海马海慧池毓焕董凌冲
中文信息学报 2012年2期
王青海,马海慧,2,池毓焕,李 颖,董凌冲
(1. 装甲兵工程学院 信息工程系,北京 100072; 2. 中国人民解放军63861部队,吉林 白城 137001;3. 中国科学院声学研究所,北京 100190; 4. 中国人民解放军63713部队,山西 忻州 036301)
1 引言
任何一个自然语言处理系统理解自然语言句子,首先要具备词的知识。词语知识库已经被广泛应用于机器翻译、信息检索、问答系统、自动文摘等领域,成为自然语言处理不可或缺的基础资源。比较著名的知识库有WordNet、FrameNet、EDR电子词典、《知网》、HNC等[1]。
目前,HNC知识库在规模上有一定的发展,但是在可扩展性和数据库设计上还有待改进。现有的HNC汉语词语知识库相对设计简单,关联性不足,增大了HNC符号解析的复杂程度,主要存在以下不足。
(1) 系统做语义距离计算时,要进行单独的HNC符号解析,检索周期长;
(2) 概念联想上完全依靠程序计算,概念之间的映射关系在数据库中没有直接的反映。
本文通过分析HNC的编码特点,改进了汉语词语知识库结构,提出了新的汉语词语知识库模型,并且通过实例说明了改进后的词语知识库在语义距离计算上的优势,指出了汉语词语知识库的发展趋势和可能存在的问题。
2 知识库模型的构建
2.1 汉语词语知识库模型设计
2.1.1 汉语词语知识库模型的提出
HNC理论利用HNC1、HNC2、HNC3和HNC4将词语、语句、句群、篇章数字化,为计算机把握语义提供基础[2]。HNC符号有两个重要特点。
(1) HNC符号是对词义的渐进表达,给出概念联想脉络知识的线索,与语种无关;
(2) HNC符号中不仅蕴含着词语层面的知识,还蕴含着语句和语境层面的知识。……
登录APP查看全文
