一种基于注意力机制的细粒度图像分类方法
2021-12-02郑承宇邓亚萍尹甜甜
云南民族大学学报(自然科学版) 2021年6期
王 婷,王 新,郑承宇,邓亚萍,尹甜甜
(云南民族大学 数学与计算机科学学院,云南 昆明 650500)
细粒度图像分类(FGVC)作为当前研究的热点,与常规的粗粒度图像分类相比,为人们提供了更加详细的图像信息,并可以区分图像中的各基本级别的类别.例如,鸟类和车辆之间存在细微的视觉差异[1-2],在区分图像中鸟和车的同时,还能分别出鸟类和车辆的特定种类和类别.由于传统的图像分类方法无法产生良好的分类效果,研究人员开始将深度学习技术引入到图像分类、识别任务中[3].
目前关于细粒度图像分类的研究已取得一些成果.例如,Huang等[4]提出1种基于多视角融合的分类方法,其主要包括使用特征图从图像中挖掘出细粒度特征和分析图像的全局特征的2个分支,最后合并2个分支;Wei等[5]提出在对物体进行检测时引入深度卷积特征的方法,应用到细粒度图像中,通过图像的注释定位目标和图像中其他可识别的地方;Lin等[6]提出了一种包含2个VGG网络的B-CNN网络,将其分别用于检测图像的目标区域和提取目标区域的特征,最后将获取的特征进行双线性融合.不同而又细微的细节特征在细粒度图像分类中起着重要作用,因此,学会区分细节的注意力机制逐渐成为最受欢迎和最有前途的研究方向,研究者们提出了各种注意力机制.例如,文献[7]中提出了一种动态反复视觉注意计算时间的DT-RAM模型,该模型能够参与动态测量中最具有区别的部分.Fu等[8]提出……
登录APP查看全文