融合空间置弃层的U-Net高分影像建筑智能解译
2021-12-17陈岩奚砚涛檀明许强万家华
陈岩,奚砚涛,檀明,许强,万家华
(1.合肥学院 人工智能与大数据学院,合肥 230601;2.合肥学院 中德应用优化研究所,合肥 230601;3.中国矿业大学 资源与地球科学学院,江苏 徐州 221006;4.安徽新华学院 大数据与人工智能学院,合肥 230031)
0 引言
建筑物是重要的地理空间数据,是基础地理信息数据库中的核心构成要素之一。基于高分辨率遥感影像的建筑物智能解译对于城市规划、城市建模、地理制图、灾害与环境管理等具有重要意义[1-2]。
近年来,以卷积神经网络(convolutional neural network,CNN)为代表的深度学习方法被广泛应用于遥感场景分类、地物对象识别检测和土地利用覆盖分类等方向,并取得了良好效果[3-4]。与传统基于光谱和面向对象的方法相比,CNN可以有效改善椒盐噪声,提高解译目标边缘精度。U-Net[5]是基于标准CNN设计的具有对称编解码结构的语义分割模型。相比基于图块的(patch-based)[6]的CNN语义分割方法,U-Net实现了端到端的语义分割,并在云[7]、车辆[8]、浮油[9]和海冰[10]等目标对象的自动提取和解译中获得了SOTA(state of the art)的结果。但需要指出的是,U-Net等深度卷积神经网络使用的最大池化层以舍弃位置信息为代价获取高级语义特征,利用上采样和编解码结构进行恢复,使得整个网络过于复杂,模型训练耗时长,难以优化,对训练使用的计算环境要求较高。另外,对于高分遥感影像建筑智能解译,由于建筑物多尺度特征,及其与周边地物对象的尺度差异性,为了提取高级语义特征,保证建筑物完整性,同时保留更多空间细节,需要充分考虑训练样本尺寸和感受野大小[11]。……
