APP下载

基于TransReID的行人重识别方法

2021-12-17王晓李丹

电子制作 2021年22期
关键词:特征信息模型

王晓,李丹

(四川大学锦城学院,四川成都,611371)

1 概述

行人重识别的目的是在不同的场景和摄像机视图中关联特定的对象,其重要组成部分是提取鲁棒特征和判别性特征,长期以来一直被基于CNN的方法所主导[1],但是基于CNN方法主要集中在较小鉴别区域以及其采用的降采样操作(池化和卷积步长)降低了输出特征图的空间分辨率,极大影响对相似外观物体的区分能力[2]。而基于注意力机制的方法大多数嵌入在深层,更偏爱较大的连续区域,并且很难提取多个多样化的可判别区域。随着多头注意力模块的引入,以及卷积和降采样操作的去除,基于Transformer的模型适合于解决基于CNN的行人重识别中的上述问题。其中多头注意模块捕获了远程依赖关系,激励模型参与人体的不同部位。而Transformer无需降采样操作,可以保留更详细的信息。但为了应对图像中的大变化(例如遮挡,姿态多样性,摄像机视角等问题),Transformer仍需要专门针对行人重识别进行设计。因此构建了一个针对行人重识别的框架——TransReID。

2 基于Transformer的行人重识别方法

■2.1 基线网络ViT-BoT

首先构建一个基于Transformer的强基线框架Vit-BoT,该方法主要分为特征提取和监督获取两个阶段。如图1所示,给定一幅图像x∈RH×W×C,其中H,W,C分别表示其高度,通道的宽度和通道数。我们把它分成N个固定大小的块{xip|i=1,2,…,N}。将其中一个可学习的向量[cls]嵌入标记为xcls,添加到输入序列之前,输入到Transformer层的输入序列可表示为:

图1 基于Transformer的强基线框架Vit-BoT

其中Z0表示输入序列嵌入,P∈(N+1)×D为嵌入的位置。……

登录APP查看全文

猜你喜欢

特征信息模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
订阅信息
3D打印中的模型分割与打包
展会信息
线性代数的应用特征
健康信息
健康信息(九则)