APP下载

基于序列标注的全词消歧方法

2012-07-09易绵竹张禄彭王之元

中文信息学报 2012年2期
关键词:特征方法模型

周 云,王 挺,易绵竹,张禄彭,王之元,4

(1. 国防科技大学 计算机学院,湖南 长沙 410073; 2. 解放军外国语学院 国防语言文化研究所,河南 洛阳 471003;3. 解放军外国语学院 欧亚语系,河南 洛阳 471003; 4. 国防科技大学 并行与分布处理国家重点实验室,湖南 长沙 410073)

1 引言

词义消歧,即在特定的上下文中确定歧义词的词义。根据词义消歧的范围,可将其分为词样消歧(Lexical-Sample WSD)和全词消歧(All-Words WSD)。词样消歧对给定文本中的某些指定词进行消歧,而全词消歧对给定文本中的所有开放词(包括名词、动词、形容词和副词)进行消歧。词样消歧是一个典型的分类问题,可使用各种成熟的有监督分类算法,如朴素贝叶斯[1]、最大熵算法[2]和支持向量机[3]等。对于全词消歧,目前通常的做法是将其当作词样消歧,对句中出现的每个开放词逐个进行消歧,各个词之间的消歧是独立的。但是,全词消歧中前后两个词的消歧实际上是相互关联的,全词消歧可以看作一个序列标注问题。

序列标注指的是对观察值序列的每个成员指定一个类别标签,因此序列标注可视为一系列的分类任务。由于序列标注利用相邻元素的依赖性对整个序列进行全局优化,一次性为所有观察值给出标签,因而标注性能通常会得到提升。常用的序列标注算法有隐马尔可夫模型(Hidden Markov Model, HMM)[4]、最大熵马尔可夫模型(Maximum Entropy Markov Model, MEMM)[5]和条件随机域[6]等。虽然HMM等序列标注方法在一些自然语言处理任务中取得了突出的成绩,如词性标注[7]和语音识别[8]等,但在词义消歧中的结果却并不理想[9-13]。……

登录APP查看全文

猜你喜欢

特征方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
3D打印中的模型分割与打包
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
线性代数的应用特征