基于CNN的连续语音说话人声纹识别
2017-04-13
(杭州电子科技大学,浙江 杭州310018)
基于CNN的连续语音说话人声纹识别
吴震东,潘树诚,章坚武
(杭州电子科技大学,浙江 杭州310018)
近年来,随着社会生活水平的不断提高,人们对机器智能人声识别的要求越来越高。高斯混合—隐马尔可夫模型(Gaussian of mixture-hidden Markov model,GMM-HMM)是说话人识别研究领域中最重要的模型。由于该模型对大语音数据的建模能力不是很好,对噪声的顽健性也比较差,模型的发展遇到了瓶颈。为了解决该问题,研究者开始关注深度学习技术。引入了CNN深度学习模型研究连续语音说话人识别问题,并提出了CNN连续说话人识别(continuous speaker recognition of convolutional neural network,CSR-CNN)算法。模型提取固定长度、符合语序的语音片段,形成时间线上的有序语谱图,通过CNN提取特征序列,经过奖惩函数对特征序列组合进行连续测量。实验结果表明,CSR-CNN算法在连续—片段说话人识别领域取得了比GMM-HMM更好的识别效果。
连续语音;语谱图;GMM-HMM;深度学习
1 引言
随着移动互联网、物联网等技术的高速发展,实现人与电子产品之间的自由交互越来越受到人们的重视。声纹识别技术在实现这一目标中扮演着非常重要的角色。语音识别技术正在走向实用。苹果公司于2011年收购了Siri公司,并在 iPhone 4上应用了语音识别功能,但当时识别体验不理想。2013-2015年,苹果公司相继收购了拥有识别整个短语的语音识别技术的Novauris公司和英国语音技术初创公司VocalIQ。与此同时,谷歌在2011年收购了语音通信公司 Say Now和语音合成公司 Phonetic Arts,2015年入资中国以导航为主的问问公司,并推出带有语音识别技术的智能手表。……
