联合总变率空间和时延神经网络的说话人识别
2021-07-22瞿于荃邵玉斌杜庆治
瞿于荃,龙 华,2+,段 荧,邵玉斌,2,杜庆治,2
1.昆明理工大学 信息工程与自动化学院,昆明 650000
2.昆明理工大学 云南省计算机国家重点实验室,昆明 650000
说话人识别(speaker verification,SV)属于生物认证领域的一种技术,是一项根据说话人语音中代表说话人生理和行为的特征参数,来判别说话人身份的技术。起初的短语音问题还没能得到广大信号处理界的重视,有些研究员们仅仅从侧面提到了短语音问题[1],并未成为说话人识别的重点。由于说话人识别对样本语音的时长非常敏感,短时语音的识别性能的好坏,是决定其能否商业化的关键一步。随着说话人系统实际项目的落地,短语音问题开始被重视起来。由于实际生活环境的限制,收集目标用户长时间的语音数据不易,而在短语音条件下获得的有效信息较少,这样就无法提取足够的说话人身份信息,直接导致识别性能的降低。在21 世纪初期,高斯混合模型通用背景模型(Gaussian mixture model universal background model,GMM-UBM)[2]的提出解决了注册说话人语料不足的问题,它的成功应用标志着说话人识别的兴起。随后,联合因子分析(joint factor analysis,JFA)[3]则对说话人变率空间和信道变率空间分别建模,以其高性能引领了说话人识别进入一个新时代。继而,基于总变率空间的身份向量(identity vector,i-vector)[4]成为了近十年来说话人识别研究的基线标准。直至深度学习流行的今日,身份向量仍占据一席之地。近来,针对短语音说话人识别的问题,大致思路分为两方面。一是特征层面,增加特征有效维度是短语音的常用方法,它能有效提高识别率。……