基于BP 神经网络的声源定位研究
2021-04-23佘霖琳赵祎彤李嘉雪宋雲龙
软件导刊 2021年4期
关键词:实验
佘霖琳,孙 红,赵祎彤,李嘉雪,宋雲龙
(上海理工大学光电信息与计算机工程学院,上海 200093)
0 引言
21 世纪以来,人工智能的兴起使得基于语音、文字、图像等模式识别的人机交互成为研究热点。要实现机器与机器以及人与机器之间的交流互动,能够精确定位发出声源的人或机器位置是极其重要的[1-2]。目前,声源定位在视频会议、助听器、智能降噪[3]、车载电话、鸣笛抓拍等领域有着广阔的应用前景。
传统声源定位算法大体可分3 类:基于到达时延估计(Time Difference of Arrival,TDOA)的声源定位算法[4]、基于最大输出功率的可控波束形成声源定位算法[5]、基于高分辨率谱估计的声源定位算法[6]。其中,第一类算法根据声源信号到达不同位置麦克风的时间差确定声源位置;第二类算法利用波束形成技术,但需基于背景噪声和声源信号先验知识,因此限制了算法应用;第三类算法来源于高分辨率谱估计技术,其定位性能好,但计算复杂度高,难以达到应用场景要求的实时性。在3 类方法中,TDOA 算法因其计算复杂度与硬件实现成本较低而受到较多关注。其发展主要分为两个阶段:第一阶段为传统的时延估计方法,以相关分析、相位谱、参数估计为基础,以数据收集作为手段进行声源定位,其中应用最广泛的为孙洋等[7]提出的基于相关分析的广义互相关函数法(Generialized Cross-Correlation,GCC)和Haykin[8]提出的基于自适应滤波器的最小均方自适应滤波法(Least Mean Square,LMS)。但GCC 算法需要对信号和噪声谱估计其加权函数,从而增加了算法复杂度。……
登录APP查看全文
