基于全局与局部标签关系的多标签图像分类方法
2022-06-21任炜白鹤翔
任炜,白鹤翔
(山西大学 计算机与信息技术学院,太原 030006)(∗通信作者电子邮箱2783800599@qq.com)
基于全局与局部标签关系的多标签图像分类方法
任炜*,白鹤翔
(山西大学 计算机与信息技术学院,太原 030006)(∗通信作者电子邮箱2783800599@qq.com)
针对多标签图像分类任务中存在的难以对标签间的相互作用建模和全局标签关系固化的问题,结合自注意力机制和知识蒸馏(KD)方法,提出了一种基于全局与局部标签关系的多标签图像分类方法(ML-GLLR)。首先,局部标签关系(LLR)模型使用卷积神经网络(CNN)、语义模块和双层自注意力(DLSA)模块对局部标签关系建模;然后,利用KD方法使LLR学习全局标签关系。在公开数据集MSCOCO2014和VOC2007上进行实验,LLR相较于基于图卷积神经网络多标签图像分类(ML-GCN)方法,在平均精度均值(mAP)上分别提高了0.8个百分点和0.6个百分点,ML-GLLR相较于LLR在mAP上分别进一步提高了0.2个百分点和1.3个百分点。实验结果表明,所提ML-GLLR不仅能对标签间的相互关系进行建模,也能避免全局标签关系固化的问题。
图像分类;自注意力机制;深度学习;知识蒸馏;多标签分类
0 引言
如何对不同标签之间存在的关系进行建模一直以来就是多标签分类尤其是多标签图像分类中的一个重要问题。以卷积神经网络(Convolutional Neural Network, CNN)[1-4]为例,在一些大型单标签图像数据集(例如ImageNet[5])上精度已能够达到90%以上[6]。然而,由于CNN独立对待目标,将多标签问题转化为一组二分类问题来预测每个目标是否存在,忽视了标签之间的依赖关系,因此很多相关研究发现其对多标签图像,例如数据集MSCOCO(MicroSoft Common Objects in COntext)2014[7]的分类精度通常仅有80%左右[2,8]。……
