APP下载

基于音视频信息融合的目标检测与跟踪算法

2021-09-27黄战华陈智林张晗笑曹雨生申苜弘

应用光学 2021年5期
关键词:融合检测

黄战华,陈智林,张晗笑,曹雨生,申苜弘

(天津大学 精密仪器与光电子工程学院 光电信息技术教育部重点实验室,天津 300072)

引言

基于视觉的目标跟踪技术广泛应用于视频会议、智能监控、智能机器人等领域。现今常用的目标跟踪算法包括粒子滤波(particle filtering)、均值漂移(meanshift)、卡尔曼滤波(Kalman filtering,KF)等[1-3]。基于视觉的目标跟踪精确度较高,但容易受到遮挡、光照等因素影响,因此存在一定的误跟现象。声源定位技术[4]可以测得声源的位置信息,虽然声源定位的精度相对较低,但不受视觉场景的影响并且测量范围更宽。考虑到单一使用视频或音频跟踪定位的缺点,试图将音频信息和视频信息融合,综合两种模态的信息实现目标检测与跟踪,使系统具有更高的准确率和鲁棒性。

视频信息与音频信息是两种不同模态的信息。多种模态的信息既能实现互补,也能提高信息的可靠性。音视频信息的融合就是一种多模态融合的方向之一。通过音视频信息的融合,可以实现复杂环境下的目标检测与跟踪。文献[5]采用序列蒙特卡洛方法融合头部轮廓和声源定位信息,实现说话人的定位。文献[6]提出一种融合目标轮廓、颜色、声源位置的说话人跟踪算法,得到稳定的跟踪效果。国内相关研究起步较晚。文献[7]采用重要性粒子滤波实现在智能教室环境下对演讲者的跟踪。文献[8]将均值漂移算法嵌入到粒子滤波算法中,将音视频跟踪结果通过粒子滤波算法融合,得到融合跟踪的结果。……

登录APP查看全文

猜你喜欢

融合检测
村企党建联建融合共赢
融合菜
从创新出发,与高考数列相遇、融合
宽窄融合便携箱IPFS500
《融合》
小波变换在PCB缺陷检测中的应用