基于注意力机制的多尺度融合人群计数算法
2024-03-21谢新林尹东旭张涛源谢刚
计算机工程 2024年3期
谢新林,尹东旭,张涛源,谢刚
(1.太原科技大学电子信息工程学院,山西 太原 030024;2.太原科技大学先进控制与装备智能化山西省重点实验室,山西 太原 030024)
0 引言
人群计数任务可以为人群监督提供技术支持,减少或避免因人员聚集而引发安全事故,因此在体育馆、音乐会、集会等人群密集场所的应用越来越广泛。然而,在现实场景中因摄像机透视效应引起的人头尺度变化大和复杂场景下背景噪声高,使得不同场景下人群计数任务面临巨大挑战。在人群计数的早期研究中主要使用基于检测[1]和回归[2]的方法,但是当遇到高度拥挤的场景图像时,该方法无法提取足够的人群特征,计数精度较低。鉴于强大的深度特征表达能力,基于卷积神经网络(CNN)的人群计数算法被广泛提出,但仍存在多尺度信息提取不足、背景噪声区分错误率高的问题。
为有效应对人头尺度变化大的问题,现有人群计数算法通常引入多尺度特征融合模块来学习不同感受野大小的特征[3-5]。许多早期方法使用多列架构网络来处理大规模变化问题[6]。例如,文献[7]构建一种多列卷积神经网络,该网络由具有不同感受野大小的3 个分支组成。但是,该方法因多分支网络的引入,导致计算量增加、训练效率降低。因此,一些改进方法尝试将高级语义信息和上下文信息融合到深度网络中[8-10],这些信息有助于网络理解拥挤人群特征。其中,文献[11]搭建一种基于分组卷积的多通道融合结构,但该方法不能有效聚合上下文信息。……
登录APP查看全文
