基于挤压和激励残差网络的歌声检测
2021-09-23桂文明吕家伟梁颖红敖志强
桂文明,吕家伟,梁颖红,敖志强
(1.金陵科技学院 软件工程学院,江苏 南京 211169;2.南京邮电大学 宽带无线通信与传感网技术教育部重点实验室,江苏 南京 210003;3.南昌航空大学 软件学院,江西 南昌 330063)
歌声检测(Singing Voice Detection,SVD)是判断存在于数字音频形式的音乐中的每一小段音频是否含有人的歌声的过程,其检测精度一般在50~200 ms之间.在每一小段音乐中,除了歌声,一般还含有演奏乐器的声音,要在混合乐器和人声的音乐片段中判断是否含有歌声,虽然对人来说是轻而易举的,但对机器来说却是颇具挑战性的工作.歌声检测是音乐信息检索(Music Information Retrieval,MIR)领域重要的基础性工作,很多其他研究比如歌手识别、歌声分离、歌词对齐等都把歌声检测作为事前必备技术或者增强技术.例如,在歌手识别过程中,首先对音乐进行歌声检测就是事前必备技术,只有检测到歌声后才能通过歌手鉴别过程进行歌手识别;在歌词对齐过程中,如果能准确地检测出歌声的位置,那么必然增强歌词对齐的准确性.
歌声检测的过程一般包括预处理、特征提取、分类和后处理等几部分,其中特征提取和分类是最重要的两大步骤.输入的音频文件一般是物理样本级的,例如wav,mp3等文件.特征提取是从音频信号中提取能表达含有歌声和不含歌声的音频之间区别的鉴别信息.较简单的鉴别信息是短时傅里叶变换后的时频图,常用的特征还包括线性预测系数(Linear Predictive Coefficient,LPC)、感知线性预测系数(Perceptual Linear Predictive Coefficient,PLPC)、过零率(Zero Cross Rate,ZCR)、Mel频率倒谱……
