基于注意力机制和辅助任务的语义分割算法
2021-09-15叶剑锋熊峻峰王化明
计算机工程 2021年9期
叶剑锋,徐 轲,熊峻峰,王化明
(南京航空航天大学机电工程学院,南京 210008)
0 概述
语义分割是计算机视觉的基础任务之一,其目的是将输入图像划分为不同语义可解释的类别,即像素级别的多类别分类任务[1]。目前,语义分割广泛应用于自动驾驶、虚拟现实、城市交通规划等领域。
传统的图像分割算法主要包括基于阈值的分割算法[2]、基于边缘的分割算法[3]、基于区域的分割算法[4]等,这些算法通常采用图像特征分类器来完成图像分割,针对分割目标设计多个特征,分别对每个特征设计一个结构复杂的特征提取器,最后构建一个分类器对所获取的特征进行识别和分类。
近年来,卷积神经网络[5-7]在图像分类任务上取得了显著成果。相比传统图像处理算法,基于深度学习的图像处理算法采用通用的学习过程,从数据中主动学习得到特征,并不需要手工设计特征[1]。
深度学习方法成功应用在图像分类、目标检测、自然语言处理等领域,其被改进、迁移到语义分割领域,图像的语义分割技术也逐渐取得突破。例如LONG 等[8]提出的全卷积神经网络(Fully Convolutional Network,FCN)在图像分类网络视觉几何组(Visual Geometry Group,VGG)网络的基础上去除全连接层,加入多级上采样还原分辨率,实现端到端的语义分割,何凯明等[9-10]在此基础上进一步加以改进。CHEN 等[11]在网络模型中引入自然语言处理中的注意力机制以实现多尺寸特征图像的加权融合,提高算法的尺寸不变性。为了增大感受野、降低特征维度、减少计算量,现有算法对输入图像做多次下采样,但在此过程中损失函数对特征的约束力越来越低,造成低层特征的离散度低,丢失大量空间细节信息。……
登录APP查看全文
