基于多特征I-Vector的说话人识别算法
2021-11-02岳鲁鹏常兆斌王伟杰
兰州理工大学学报 2021年5期
赵 宏, 岳鲁鹏, 常兆斌, 王伟杰
(兰州理工大学 计算机与通信学院, 甘肃 兰州 730050)
说话人识别(speaker recognition,SR)又称声纹识别(voiceprint recognition,VR),是一种根据语音信息对讲话者身份进行辨识的生物特征识别技术.该技术的作用原理是根据语音中能够描述和反映讲话者独特特征的信息,通过信息识别等一系列先进成熟的技术高效、智能地辨识讲话者身份[1-2].与面部识别等其他识别技术相比,说话人识别优势突出,它不仅操作便捷、成本较低,并且识别精度高,已经在金融、军事等多个行业得到了大力推广和积极应用,应用前景非常可观.
目前,关于说话人识别的研究,学者们一般从前端处理和后端处理这两点出发展开探讨和分析.
在前端处理上,Esun等[3]从语音特征入手,通过对声学特征参数的分析,提出了一种基于DBN-GMM混合模型的深层高斯相关超矢量(deep Gaussian correlation super vector,DGCS)特征,从而降低了系统的错误率和训练复杂度.Agrawal等[4]从时-频特征入手,通过对语音频谱图进行分析,提出了使用语音频谱图学习初始滤波器,而使用残差谱图学习后续滤波器的方法,从而抑制了易受噪声干扰的区域,提高了系统的鲁棒性.李作强等[5]从相位特征入手,通过对相位信息的分析,设计出了相位特征参数提取算法,不仅使得系统识别率进一步提升,同时也明显增强了系统鲁棒性.张二华等[6]从噪声干扰入手,通过对噪声环境下的说话人确认系统分析,探索出了一种以分区约束非负矩阵分解为基础的语音去噪策……
登录APP查看全文
