基于全卷积网络的图像语义分割算法
2020-09-02李英杰张惊雷
李英杰 张惊雷
1(天津市复杂系统控制理论及应用重点实验室 天津 300384)2(天津理工大学电气电子工程学院 天津 300384)
0 引 言
语义分割通过为图像中每个像素分配特定标签来解决像素的分类问题[1],长期以来是计算机视觉中重要且具有挑战性的课题,其成果广泛应用于自动驾驶、场景分析、医疗影像、图像搜索等领域[2]。随着深度学习算法尤其是深度卷积神经网络(DCNN)[3-4]的迅速发展,传统的基于人工标记提取图像低级特征进行模型训练的语义分割技术逐渐被基于深度学习的方法取代。基于深度卷积网络的语义分割技术不仅可以实现端到端的训练,而且能获得更精确的结果,受到了研究者的广泛重视。
文献[5]于2014年提出了全卷积网络(Fully Convolutional Networks,FCN),这是深度学习首次应用在语义分割领域,其具体操作是用卷积层代替全连接层,在端到端的卷积网络中进行密集预测,实现图像任意大小的输出。此后许多学者提出的算法都是基于这种思想进行改进。Badrinarayanan等[6]提出的SegNet,使用最大池化定位来得到更准确的位置信息; Yu等[7]提出的Dilated Convolutions,通过空洞卷积进行密集预测;Lin等[8]提出的RefineNet,通过改进编码解码结构,提升了网络性能;Zhao等[9]提出的PSPNet,使用金字塔池化模块聚合多尺度信息,并在ResNet网络中加入附加损失,获得了较好的效果;Peng等[10]提出的Large Kernel Matters,虽然可以获得较大感受野,但大卷积核计算量大、占用内存多,增加了计算成本;Yu等[11]提出的判别特征网络(Discriminative Feature Network,DFN),解决了图像中类内不一致和类间无差别的问题。……
