APP下载

基于样本冗余度的主动学习优化方法

2021-03-16范纯龙王翼新张振鑫

计算机应用与软件 2021年3期
关键词:实验方法

范纯龙 王翼新 宿 彤 张振鑫

1(沈阳航空航天大学计算机学院 辽宁 沈阳 110136) 2(辽宁省大规模分布式系统实验室 辽宁 沈阳 110136)

0 引 言

近几年,图像识别及其分类是深度学习领域中的重要应用,其中有监督学习是重要方法之一。但是利用该方法解决图像分类问题需要大量的有标签数据,然后利用分类器的参数学习样本中的特征,从而达到较好的分类效果。对于大量有标签数据的需求,网络技术的普遍应用可以使人们很容易获得海量数据,但是在一些实际应用中[1-3],取得无标签样本很容易而标注样本是代价昂贵或耗费时间的。基于此类常见的问题,Angluin[1]提出了“主动学习”。

主动学习的目的是减少对样本数据的标注成本,用最少的有标签样本达到接近全样本训练效果。主动学习按照样本抽样模式可分为流样本模式和池样本模式,由于流样本模式的选择策略需要根据不同的任务进行适当的调整,很难作为通用方法使用。所以,近些年来主动学习主要在池样本模式上发展[4-6],即在固定的大量无标签样本集中,根据选择策略反复选择对当前分类器而言信息量大的样本,其中按照选择策略原理不同,主要有基于不确定度[3,5,7-8]、泛化能力[9-10]、模型空间[11-12]等方法。这些策略都是根据样本与当前分类器或样本分布之间的关系,每次选择的样本数量多、信息量大且训练效果明显,但是没有考虑到样本对分类器而言信息重叠问题,即信息冗余问题。尽管每次选择样本的信息量足够大,但是信息冗余问题会导致选择多余的无意义样本,主动学习会因此失去意义。……

登录APP查看全文

猜你喜欢

实验方法
记一次有趣的实验
做个怪怪长实验
学习方法
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
《实验流体力学》征稿简则