噪声环境下多特征融合的语音端点检测方法
2021-08-09罗思洋邵玉斌杜庆治
云南大学学报(自然科学版) 2021年4期
罗思洋,龙 华,邵玉斌,杜庆治
(昆明理工大学 信息工程与自动化学院,云南 昆明 650500)
语音信号中的语音段是由清音段和浊音段构成的[9],只有同时兼顾语音段中清音与浊音的追踪能力,并且提升端点检测方法在不同信噪比和不同噪声环境下的鲁棒性,才能进一步提升端点检测方法的性能.结合上述分析,本文提出了一种多特征融合的语音端点检测方法.通过研究发现,Gammatone频率倒谱系数的第一维系数GFCC0在噪声环境下对语音段中的清音和浊音都有较好的追踪能力,子带谱熵特征对语音段中的浊音追踪能力较好,而结合MFCC 系数和Fisher 线性判别的投影特征[10]对语音段中的清音有较好的追踪能力.因此考虑将GFCC0作为多特征融合的首要特征,结合子带谱熵特征和投影特征进一步提升对语音段的追踪能力,通过自适应加权融合的方法得到用于端点检测的融合特征.仿真实验证明,本文方法在-5~5 dB信噪比的white 噪声和-5~15 dB 信噪比的babble、
噪声环境下的语音端点检测就是从带有背景噪声的语音信号中区分出语音段和噪声段,从而提高语音信号的利用率[1].随着智能语音技术的发展,语音端点检测已经广泛应用到了语音识别、语音增强和音频分类技术的前端.例如端点检测可以简化语音识别过程中的冗余数据,加快语音识别系统的速度[2].
在漫长的发展历程中出现了上百种语音端点检测方法,可以将这些方法归结为基于模式识别和基于特征的方……
登录APP查看全文