改进DSB方法的语音信号多声源定位
2021-01-11黄丽霞张雪英
王 杰,黄丽霞,张雪英
太原理工大学 信息与计算机学院,太原030024
声源定位在军事和民用领域具有许多应用,例如混合音频信号分离、视频会议、语音增强、声源跟踪、水下声学、指导机器人和高级助听器[1-4]。传统的声源定位算法分为三大类:(1)到达时间差TDOA(Time Difference of Arrival);(2)高分辨率谱估计;(3)波束形成[5]。到达时间差TDOA方法,如GCC[6](Generalized Cross Correlation)算法,主要由于其计算量小的特点被广泛应用,但仅适用于单声源信号定位,在多个声源下定位性能较差。基于高分辨谱估计的方法主要用于窄带和远场信号处理,如MUSIC[7](Multiple Signal Classification)算法、ESPRIT[8](Estimating Signal Parameter Viarotational Invariance Techniques)算法与加权子空间拟合算法[9]等,基于高分辨谱估计的方法运算量大,且对阵列误差非常敏感,方位分辨信噪比门限较高,应用到实际环境下较为困难[10]。而波束形成方法在方向估计上具有良好的稳定性。目前针对窄带信号的多声源波束形成定位技术已比较成熟,如延迟求和波束形成DSB[11](Delay and Sum Beamforming)、LMS[12](Least Mean Square)和MVDR[13](Minimum Variance Distortionless Response)等算法。延迟求和波束形成(DSB)是最简单的波束形成,尽管其分辨率较低,但由于具有稳健性高、不需要目标信号先验知识、运算量低等优点,依然得到广泛运用。然而在实际信号环境中,声源定位面对的更多是语音宽带信号。语音信号包含着更多的频率分量,分析更加复杂[14]。此外在利用波束形成识别语音信号源时,由于语音信号频率高低不同,会存在着旁瓣、栅瓣[15-16]等问题。因此针对多个宽带语音信号源角度估计研究也更具挑战性。国外,针对DSB方法改进有很多研究,但在多声源定位应用……
