基于生成对抗网络的半监督图像语义分割
2021-12-29刘其朋
复杂系统与复杂性科学 2021年1期
朱 锋,刘其朋
(青岛大学复杂性科学研究所,山东 青岛 266071)
0 引言
图像语义分割是一种视觉场景理解任务,目的是为输入图像中的每个像素点分配类别标签,从而对图像中的物体进行语义层面上的划分,如某一区域的像素点属于车辆、行人、树木等。语义分割被广泛应用于自动驾驶、医学图像分析等领域[1-2]。图1展示了语义分割的示例。

图1 语义分割示例[3]
目前比较流行的语义分割方式大多是以全卷积神经网络(Fully Convolutional Network, FCN)为基础构造的[4]。FCN的特点是将普通卷积神经网络(Convolutional Neural Network,CNN)中的全连接层替换为卷积层,从而可以接受任意尺寸的输入图像,然后利用转置卷积操作对特征图进行上采样,得到与原图大小相同的语义分割图像。基于FCN的语义分割会随着网络层次的深入逐渐丢失原图中的空间结构信息而变为独立的单点像素分类预测,需要额外添加全局结构约束才能获得较好的分割效果。比较常用的方式是通过条件随机场(CRF)[5]或者马尔可夫随机场(MRF)[6]等捕捉远程像素点之间的依赖关系。
近年来随着生成对抗网络(Generative Adversarial Networks,GAN)[7]的提出和广泛应用,对抗式的训练模式为语义分割提供了新的解决方案。Luc等人首次将GAN框架引入语义分割任务中[8]。该框架包括一个分割网络和一个判别网络,前者用于完成语义分割任务,后者可以从全局层面评判语义分割的效果,从而为分割过程添加了像素点之间的依赖关系约束。
相比于物体识别和目标检测问题,语义分割要求的标签是像素级别的,因此人工标定训练数据集工作量很大。……
登录APP查看全文
