APP下载

基于隐最大熵原理的汉语词义消歧方法

2012-06-29张仰森黄改娟苏文杰

中文信息学报 2012年3期
关键词:语义特征信息

张仰森,黄改娟,苏文杰

(北京信息科技大学 智能信息处理研究所,北京 100192)

1 引言

汉语词汇中的多义词始终是自然语言理解中难以处理的问题,多年以来,关于汉语词汇的语义消歧研究一直是中文信息处理领域的研究热点。词义消歧从研究方法上讲主要有基于规则的方法、基于词典知识的方法、有指导的统计消歧法、无指导的统计消歧法[1]。其中有指导的统计词义消歧法是目前WSD领域的主流,它将词义消歧问题作为分类问题来考虑,将机器学习领域里广泛流行的算法用于词义消歧,包括决策树(Decision Tree)方法(Black,1988)[2]、决策表(Decision List)方法(Yarowsky)[3]、Naïve Bayes方法[4]、向量空间模型(VSM)[5]、最大熵方法(Maximum Entropy)[6-7]、神经网络模型[8]、基于实例的方法[9]等。其中,最大熵方法由于可以将多种上下文特征集于统一的模型框架之中,词义消歧效果比较好,受到学界的广泛应用。最大熵模型与n-gram模型相比,能够获取和使用自然语言多个方面的信息特征,将多种特征信息集成于一个模型之中,与朴素贝叶斯模型、决策树等统计语言建模方法相比,有无需独立性假设及自动特征权重确定的优点。但其主要缺点是只能处理显性统计特征信息,对那些自然语言中经常遇到的语义和句法信息无法进行处理。

为了将自然语言中人们不能直接观察到的隐性特征,如语义信息或语法结构引入最大熵方法中,本文提出基于隐最大熵原理的词义消歧方法,将语义搭配特征等隐性特征与显性统计特征等一同引入一体化的指数性概率框架模型之中,以提高汉语词汇的语义消歧正确率。……

登录APP查看全文

猜你喜欢

语义特征信息
语言与语义
如何表达“特征”
不忠诚的四个特征
订阅信息
“上”与“下”语义的不对称性及其认知阐释
认知范畴模糊与语义模糊
展会信息
线性代数的应用特征
语义分析与汉俄副名组合
健康信息