基于SRP-PHAT 的实时声源定位算法设计与实现
2021-08-02刘生
软件导刊 2021年7期
刘 生
(南京熊猫电子装备有限公司,江苏南京 210046)
0 引言
近年来,随着人工智能及交互技术的发展,越来越多智能设备可以实现人机对话。为了提高自动语音识别率,业内通常使用波束形成技术进行定向收音,获得了较好的收音效果[1]。针对一些如智能音箱、机器人等智能对话设备,为了实现全向的高效收音,通常会在对话开始时利用声源定位技术获得声音的方向,并将其作为参数传给后续的波束形成部分进行处理。
常用的声源定位算法主要有基于最大可控响应功率的波束形成方法、基于高分辨率谱估计的方法与基于时延估计的定位方法[2-4]。基于相位变换加权的可控波束响应功率(Steered Response Power-Phase Transform,SRP-PHAT)声源定位算法由于具有较强的鲁棒性,可实现真实环境中的声源定位,因此也得到了广泛应用[5-6]。由于算法运算量较大,在嵌入式系统中,为提高算法的实时性,一般使用FPGA 或专用CMOS 芯片进行算法实现[7-8]。在智能语义交互产品中,目前的主流技术是使用Linux 或Android 系统进行网络通信,连接语音对话服务器,实现语义识别、语义处理及语音合成。这部分功能需要使用通用ARM 处理器进行实现,如果使用FPGA 或专用CMOS 芯片实现语音定位及前端语音处理部分功能,势必会提高产品复杂度,成本也会随之升高。本文基于ARM 平台处理器,使用Python 及C++语言对算法进行设计与实现。将原来利用专用芯片实现的前端语音功能在嵌入式ARM 平台上重新进行设计与实现,对产品集成度进行了提升。……
登录APP查看全文
