面向多类别分类问题的子抽样主动学习方法
2021-03-02黄红蓝冯旸赫
系统工程与电子技术 2021年3期
施 伟,黄红蓝,冯旸赫,刘 忠
(国防科技大学系统工程学院,湖南 长沙 410073)
0 引 言
有监督学习是利用标记样本不断调整模型参数以达到性能要求的过程。随着技术进步,能够获取大规模样本数据,提高模型预测性能。然而,即使是对相关领域内的专家来说,给数据加上标签也常常是一项昂贵和耗时的任务。文献[1]中使用的数据集收录了总计367 835字的实验样本,用于军事文本的命名实体识别实验。在文献[2]所研究的航天遥感图像场景分类问题中,一个普通规模的数据集包含31 500张涉及45类场景类别的图像样本,每个样本至少包含196 608个像素。丰富的图像变化、类内多样性和类间相似性使得标注这类数据集更具挑战性。
为解决这类问题,主动学习方法应运而生,用于对未标注数据集的自动标注。文献[3-4]中的策略倾向选择具有最大不确定性的样例交给专家进行标注,使用尽量少的样例获得尽可能高的分类性能。文献[5-6]中的基于专家委员会投票的查询策略是训练一个分类器委员会,并选择最具分歧的实例来分析查询,是一种从随机输入流中过滤信息的方法。上述主动学习策略都属于短视主动学习的范畴,共同的缺点是只根据已标注实例的信息和基于此训练出的分类器来选择将要查询的实例,忽略了大量未标注实例的分布信息。
鉴于上述算法的缺陷,另一类算法试图从大量未标记实例中获取信息,建立一个对问题域中不可见的实例具有良好泛化性能的分类器。……
登录APP查看全文
