基于样本冗余度的主动学习优化方法
2021-03-16范纯龙王翼新张振鑫
计算机应用与软件 2021年3期
范纯龙 王翼新 宿 彤 张振鑫
1(沈阳航空航天大学计算机学院 辽宁 沈阳 110136) 2(辽宁省大规模分布式系统实验室 辽宁 沈阳 110136)
0 引 言
近几年,图像识别及其分类是深度学习领域中的重要应用,其中有监督学习是重要方法之一。但是利用该方法解决图像分类问题需要大量的有标签数据,然后利用分类器的参数学习样本中的特征,从而达到较好的分类效果。对于大量有标签数据的需求,网络技术的普遍应用可以使人们很容易获得海量数据,但是在一些实际应用中[1-3],取得无标签样本很容易而标注样本是代价昂贵或耗费时间的。基于此类常见的问题,Angluin[1]提出了“主动学习”。
主动学习的目的是减少对样本数据的标注成本,用最少的有标签样本达到接近全样本训练效果。主动学习按照样本抽样模式可分为流样本模式和池样本模式,由于流样本模式的选择策略需要根据不同的任务进行适当的调整,很难作为通用方法使用。所以,近些年来主动学习主要在池样本模式上发展[4-6],即在固定的大量无标签样本集中,根据选择策略反复选择对当前分类器而言信息量大的样本,其中按照选择策略原理不同,主要有基于不确定度[3,5,7-8]、泛化能力[9-10]、模型空间[11-12]等方法。这些策略都是根据样本与当前分类器或样本分布之间的关系,每次选择的样本数量多、信息量大且训练效果明显,但是没有考虑到样本对分类器而言信息重叠问题,即信息冗余问题。尽管每次选择样本的信息量足够大,但是信息冗余问题会导致选择多余的无意义样本,主动学习会因此失去意义。……
登录APP查看全文
