基于深度神经网络和多特征融合的语音端点检测
2021-08-03陈爱华张石清
台州学院学报 2021年3期
陈爱华,张石清
(台州学院 电子与信息工程学院,浙江 台州 318000)
0 引言
语音端点检测(Voice Activity Detection)是语音识别领域一个重要内容,是语音信号处理的第一步,它主要是从音频文件中确定语音片段的起止点,进而分辨出语音信号和非语音信号区域[1]。研究表明,即使是在理想条件下,语音识别技术的错误大部分都是由语音端点检测不准确造成的[2],因此语音端点检测在语音信号处理中具有重要的意义。
当前,语音端点检测的方法很多,早期算法主要是基于时域特征进行检测[3],如最早的语音端点检测是以语音的短时能量和过零率特征来实现的[4],后来人们又将语音信号从时域转换到频域,并将熵特征引入到语音端点检测中[5],提出了基于频带方差的检测[6]、基于共振谐波的检测[7]、基于倒谱域特征的检测[8]等等。随着人工智能的不断发展,新的算法不断涌现,小波分析、人工神经网络、支持向量机等技术也应用到了语音端点检测中[9-11],取得了较好的效果。但在实际语言环境中,由于语音背景环境复杂,单一的语音端点检测算法难以适应各种环境,算法的鲁棒性和准确性不高。近年来,新发展起来的深度神经网络(Deep Neural Network,DNN)通过采用多层网络结构进行层次化特征学习,表现出强大的非线性学习能力和预测能力[12],特别是在语音信号识别和增强方面表现出了优越的性能[13-15][16]211。音频文件的耳蜗特征具有较好的语音识别能力和噪声鲁棒性[17]168;短时特征可以有效地区分音频信号的清音段和浊音段[18]755;……
登录APP查看全文
