基于残差注意力U-Net 结构的端到端歌声分离模型
2021-10-26汪斌,陈宁
汪 斌, 陈 宁
(华东理工大学信息科学与工程学院,上海 200237)
大多数音乐录制文件,例如来自YouTube、Spotify、网易云音乐的文件,以多个音源共享一个音轨的混合形式发布。将混合音频分离成单个音源的过程称为音乐源分离(Music Source Separation, MSS)。歌声分离(Singing Source Separation, SVS)是音乐源分离的一种特例,分离过程中将所有的乐器都视为一个音源,目标是将混合音频分离为歌唱人声和背景音乐伴奏两种音源[1]。近年来,由于在音乐旋律提取[2]、音乐流派分类[3]、歌声检测[4]、歌手识别[5]等方面的潜在应用,SVS 已成为音乐信息检索(Music Information Retrieval, MIR)领域的研究热点。
基于非负矩阵分解(Non-negative Matrix Factorization,NMF)[6]的方法以及基于F0 估计的方法[7]是用于歌声分离任务的传统监督方法。随着深度学习技术在音乐信息检索领域的迅猛发展[8],基于深度神经网络的歌声分离技术受到了学术界的关注。文献[9]第一次将卷积神经网络(Convolutional Neural Network,CNN)结构引入SVS 任务,但是所提出模型的层数较深,训练比较困难,同时由于用于SVS 任务的公开数据集较小,因此模型的泛化能力很难得到保证。为了解决上述问题,一种最初用于医学图像语义分割任务的编-解码器结构U-Net[10]在文献[11]中被首次应用于SVS 任务。该方法利用U-Net 结构分析混合音频的语谱图,然后通过预测对应于单个音源的时频掩码来达到分离音源的目的。U-Net 结构在SVS任务中的优势是:一方面,其编-解码结构使得其在有限的训练样本下进行有效的训练成为可能;另一方面,编码块和解码块中包含的多个连通卷积层有助于从语谱图中提取语义特征。……
