多级特征融合下的高精度语义分割方法
2021-11-16王晓华叶振兴王文杰
王晓华,叶振兴,王文杰,张 蕾
(西安工程大学 电子信息学院,陕西 西安 710048)
0 引 言
图像语义分割是图像理解中的一项基本任务,其目标是为输入图像中的每个像素分配一个类别标签,对图像进行像素级分类。因而在图像场景理解[1]、弱监督语义分割[2]、视觉跟踪、场景分析[3]、视频处理和医学图像分析[4]等领域都得到了广泛应用。
近年来,卷积神经网络(convolutional neural networks,CNN)极大地增强了图像的理解能力,基于深度学习的语义分割方法受到国内外学者的广泛关注。研究者在CNN的基础上丢弃全链接层,提出了全卷积网络(fully convolutional network, FCN)[5]。FCN可以处理任意分辨率的图像,成为最流行的语义分割网络结构;文献[6-7]在FCN中采用扩张的卷积层,来增加特征提取网络中的感受野;文献[8-10]在FCN的基础上设计了基于编码器-解码器的网络结构,编码器用以降低特征映射的分辨率,解码器用来提高特征映射的采样以恢复分辨率;文献[11]提出在实际应用中,编码器的下采样容易丢失高分辨率特征;为了获取高分辨率特征,文献[12]中U-Net为解码器提供了具有相同分辨率的编码器特征图;文献[13-14]中HR-Net通过简单的卷积网络来维护高分辨率的特征图,并通过拼接来融合不同分辨率的特征图;DeeplabV3+[15]中采用跨层融合的思想,将浅层细节特征与深层抽象特征结合起来,提高高分辨率细节信息的分割精度;PSP-Net[16]引入了金字塔池化模块(pyramid pooling module,PPM),能够聚合不同区域的上下文信息,从而提高获取全局信息的能力。虽然上述方法增强了特征的表现力,但是在小目标物体分割和物体边缘分割精度上仍有待提升。……
