基于金字塔场景分析网络改进的语义分割算法
2021-10-14孟凡云王金鹤
计算机工程与应用 2021年19期
王 嘉,张 楠,孟凡云,王金鹤
青岛理工大学 信息与控制工程学院,山东 青岛 266000
语义分割是计算机视觉中一个重要的分支领域,其目的是为图像当中每个像素标记类别标签,从而表示该像素的语义信息,采用学习到的算法模型预测同分布新图像的每个像素标签,将不同类别的对象分割出来。语义分割在自动驾驶、遥感图像分析、机器人传感、医疗图像等方面有着广泛的应用[1-2]。对于这一类问题,如何在预测图像中具有良好的推理精度,有效区分易混淆的类别,以及图像中边缘轮廓的细化是要解决的问题关键。
在早期,传统分割任务由于计算能力有限,只能处理一些灰度图,经历了一段时间的发展之后开始能够处理RGB 三通道图,此时主要通过提取图片的低级特征来进行分割,出现了Ostu[3]、N-Cut[4]等方法,但是它们分割出来的结果并没有语义的标注。伴随着计算机计算能力的提高,图像的语义分割成为了研究的重要课题之一。全卷积神经网络(Fully Convolutional Networks,FCN)[5]的出现,使得图像语义分割领域取得了巨大的进步,当前最先进的语义分割框架大多数是基于FCN 实现的,如PSPNet[6]、Deeplabv2[7]、Deeplabv3[8]等。PSPNet引入金字塔池化模块,加强了对局部信息的利用,Deeplabv2 通过使用不同空洞率的空洞卷积进行采样,多尺度的捕捉图像上下文,并采用条件随机场增强细节捕获的能力,Deeplabv3 在Deeplabv2 基础上继续改进了空洞卷积部分结构。这三个结构识别精度较FCN均有明显提升,但对图像中对象边界轮廓的处理仍是要关注的问题。……
登录APP查看全文
