基于主动学习的中文依存句法分析
2012-06-29车万翔张梅山
中文信息学报 2012年2期
关键词:方法
车万翔,张梅山,刘 挺
(哈尔滨工业大学 计算机学院 社会计算与信息检索研究中心,黑龙江 哈尔滨 150001)
1 引言
在统计学习的模型训练过程中,按照对训练实例的处理方式,可将学习过程分为两类: 主动学习和被动学习。被动学习是随机地选择训练实例,被动地接受这些样本信息。主动学习与被动学习不同,它是迭代地从未标注语料中优先选择最富含有效信息的实例(即当前模型预测最不准的)交由人工标注,然后加入训练集重新训练。由于优先选择的是最具训练效用的样本,所以减少了那些对提高学习器精度帮助不大的冗余样本的标注,因而学习器只需更少的样本便能获得相同精度[1-2]。
目前最广泛使用的主动学习方法有基于不确定性度量(Uncertainty-based Sampling)和基于委员会投票(Query-by-committee)两种[1]。
基于不确定性度量的样本选择根据学习器对未标注样本的分类置信度来进行。样本分类置信度越低,说明学习器尚不能很好区分此样本,即学习器缺乏此样本含有的信息。此时将该样本进行人工标注并加入训练集会对学习器精度的提升有很大帮助。对于分类置信度高的样本,不再人工标注,从而免除了在冗余样本上耗费人力。这类学习算法的重点是构造一种合理有效的不确定性度量机制,以此来指导样本选择。
基于委员会投票的样本选择需要构建一组分类器,这些分类器可以是用不同的训练算法得到(SVM、MaxEnt等),也可以是用同种训练算法对样本从不同的特征角度训练得到(Multi-view active learning[3])。……
登录APP查看全文
