一种有效的困难样本学习策略
2021-07-01蔡晓东
西安电子科技大学学报 2021年3期
关键词:方法
曹 艺,蔡晓东
(桂林电子科技大学 信息与通信学院,广西壮族自治区 桂林 541004)
哈希学习[1]大致分为非监督哈希和监督哈希。在监督哈希学习中,使用深度神经网络相对于一些手工设计的哈希算法能获得更好的效果。大部分深度哈希算法都采用相似性保留算法,该方法包括单对相似性保留、多对相似性保留、隐式相似性保留。基于单对相似性保留的方法[2-6]通过计算两个样本的距离来学习样本的相似性信息。也有一些通过其他方法[7-10]进行哈希特征学习和量化的工作。基于深度神经网络的单对相似性保留方法在学习过程会产生两个方面的问题。
一方面,存在一些很难被正确学习的困难样本导致模型准确性下降,如何有效地学习到困难样本的特征信息成为一个棘手的问题,在线困难样本挖掘算法[11]是其中一种简单有效的方法。它通过找到困难样本,组成新的训练批次进行训练,但延长了训练时间。相对于文献[11],文献[12]提出了Focal Loss损失函数设计机制,通过给困难样本大权重来控制损失,该机制使用了更少的前向传播次数并进一步提升了训练效率。此机制被用到了深度哈希领域[2],但是该机制在处理不同的问题上缺乏泛化能力[13-14]。
另一方面,在训练样本数量不平衡的情况下,过量的困难样本会造成模型收敛偏移,从而降低模型的准确性[15]。在处理训练样本不平衡的问题时主要有两种方法:一种是改变样本的分布,通过采样(重采样或欠采样)改变训练样本数量或通过数据增强如旋转、镜像、混合训练,或者生成对抗网络等生成伪样本来提高稀少样本的多样性。……
登录APP查看全文
