基于语音分离的人工设计特征、参数化特征和可学习特征的比较
2021-10-27朱文博王谋张晓雷SusantoRahardja
朱文博,王谋,张晓雷,Susanto Rahardja
(西北工业大学航海学院智能声学与临境通信研究中心,陕西西安 710072)
1 引言
语音分离的目的是将多个音源的混合语音分离成其对应成分。在本文中,我们研究了基于深度学习的说话人无关情况下的语音分离,其中说话人无关的情况是指训练时所用到的说话人与测试中的说话人可以不相同[1]。Hershey 等人首先提出用深度聚类的方法来解决语音分离问题[2]。在此之后,针对语音分离问题又提出了多种方法,例如置换不变训练[3-4],深度吸引子网络[5]。在这些方法中,被广泛应用的声学特征是短时傅里叶变换的幅度谱(short -time Fourier transform,STFT)。然而,在从分离后的幅度谱恢复成时域信号的过程中,所用到的是含有噪声的相位谱,这会导致得到次优的性能。
为了克服这一缺陷,数据驱动的从时域到时频域变换的可学习特征成为了新的趋势。其中代表性的就是一维卷积滤波器(1D-conv)[6-9]。由于该变换是与分离网络联合训练的,并且不需要额外的人工操作,因此该变换相比于STFT来说使语音分离的性能得到了提升。在这些时域方法中,Conv-Tasnet在帧长设置为仅2 毫秒的低时延情况下得到了杰出的分离性能,从而受到了广泛的关注。
近期有一些工作旨在研究Conv-Tasnet 的声学特征。例如,Ditter 和Gerkmann 用人工设计特征[10],即多相位gammatone滤波器组(MPGTF)来代替Conv-Tasnet中编码器部分的可学习特征,并在尺度无关信噪比(scale-invariant source-to-noise,SI-SNR)上带来了提升。Pariente 等人将参数化滤波器扩展为了复值的解析滤波器[11-12],同时他们也提出了类似的一维卷积滤波器的解析版本。……
