深度学习说话人识别中语音特征参数提取研究
2021-05-13张兴明杨凯
张兴明,杨凯,2
(1.四川大学视觉合成图形图像技术国防重点学科实验室,成都610065;2.四川川大智胜软件股份有限公司,成都610045)
0 引言
近年来随着深度学习技术的迅猛发展和计算机硬件设备的计算能力大幅提升,生物特征识别技术的研究进展迅猛。部分生物特征识别技术已趋于成熟,逐渐在从学术研究阶段走向商业应用阶段。在众多生物特征识别技术中,声纹识别技术相比于其他生物特征识别技术,它有着其独特的优势:安全性高、隐私性弱、采集便捷、非必须接触等。正是由于声纹识别所具有的这些独特优势及其应用价值,使得越来越多的研究者投入到声纹识别技术的研究中。
近年来,得益于深度学习技术强大的学习能力,使得基于深度学习的说话人识别研究成为说话人识别领域的一个研究热点。2014 年Google 提出了d-vector[1]识别模型,它将Filterbank 特征参数作为模型输入,使用DNN 网络构建了一个简单的识别模型,将最后一个隐藏层作为说话人特征。它仅使用一个简单的网络模型,就取得了不错的识别效果。d-vector 对说话人识别研究贡献巨大,它掀起了基于深度学习的说话人识别研究热潮。通过阅读相关文献,发现大多数研究使用的是单一的传统语音特征作为模型输入数据,x-vector[2]识别模型使用24 维Filterbank 特征参数,h-vector[3]识别模型使用20 维的MFCC 特征参数,百度在2017 年提出的deepSpeaker[4]系统使用的是64 维的Filterbank 特征。还有少数研究使用神经网络来学习语音特征。Chen Nanxin 等人[5]提出的j-vector 识别模型使用深度神经网络来作为一个特征提取器,通过训练后该特征提取器可以学习得到语音特征。……
