图像匹配的物体空间关系推理表达
2021-01-18王玮琦
李 钦,游 雄,李 科,王玮琦
信息工程大学地理空间信息学院,河南 郑州 450001
图像匹配是众多视觉任务的基础环节,如即时定位与地图构建(simultaneous localization and mapping,SLAM)中的闭环检测[1-2]、图像检索[3-4]以及视觉定位[5-6]等。图像匹配的关键在于判断图像中是否包含相同的物体,由于现实世界场景的复杂性,同一物体在不同图像中会呈现不同的形态,同时不同物体在各自图像上的成像也可能会很相似,只有准确地表达图像中物体间的相互关系,才能有效地解决图像匹配问题。
特征提取与相似度计算是图像匹配的基本步骤[7],特征提取的目的是对丰富的图像信息进行抽象简化表达,进而构建用以表达图像的描述向量。常见的图像特征如SIFT[8]、SURF[9-10]和ORB[11]等,仅仅表达了特征点周围区域信息,为了构建整幅图像的最终表达,需要进一步对图像包含特征进行聚合,常见的聚合模型包括BoW(bag of words)模型[12-13]、VLAD(vector of locally aggregated descriptors)模型[14]以及FV(fisher vector)模型[15-16]等。相似度计算的实质是度量图像间的距离,在构建图像整体表达的基础上,计算图像间的特征距离,设置距离阈值判定图像是否匹配。
近年来,深度学习在各种视觉应用中取得了巨大的成功,其通过对输入图像的层层特征提取,不断挖掘隐藏在图像内部的抽象语义信息,更能表达图像的本质,因此基于深度学习构建的图像特征具有更强的表达能力。受VLAD模型[14]的启发,文献[17]训练NetVLAD模型构建影像的整体表达,首先利用一般的CNN网络模型提取影像特征,然后在网络中添加NetVLAD层构建影像的VLAD描述符,NetVLAD模型在影像匹配实践中取得了很大的成功。……
