基于深度学习的开放场景下声纹识别系统的设计与实现
2021-12-06郭新罗程方邓爱文
郭新 罗程方 邓爱文
0 引言
声纹作为生物特征识别中的一种行为特征,因其蕴含丰富的个人信息,比如性别、年龄、情绪、语种等,被作为身份识别的一种方式,且因其伪造难度高、隐私性弱、辨识性强等优势,近些年来引起了业界广泛的关注.2018年被称为“声纹元年”,是声纹技术迈向产业化的重要转折点,这一年,中国人民银行发布了《移动金融基于声纹识别的安全应用技术规范》(JRT0164—2018)[1].声纹识别技术在国内正逐渐被应用于金融、社保、公安、智能家居等重要领域.
在学术界,声纹识别又称说话人识别,它是提取语音信号中能够表征说话人个性特征的信息,利用传统机器学习或深度学习,自动地实现说话人身份识别的一种生物特征识别技术.声纹识别(Speaker Recognition,SR)分为声纹辨认(Speaker Identification,SI)和声纹确认(Speaker Verification,SV)[2],其中声纹辨认是1∶n任务,声纹确认是1∶1任务,本文算法主要是基于SV的,整个系统的实现是两者兼有.目前,说话人识别应用的痛点是短时语音和基于开放环境的噪声影响,这就是本文的主要研究内容之一.
20世纪90年代,声纹识别最经典的模型是GMM-UBM模型及i-vector,在深度学习之前,它们一直是占据业界的主流技术.近些年来深度学习下的声纹研究已呈现愈来愈繁荣的局面,从深度卷积网络下的d-vector技术到x-vector技术[3],尤其x-vector是当前声纹领域中主流的模型框架.x-vector框架下的主要研究内容包括声音预处理、特征提取层、特征编码层和损失函数的优化.对于声音预处理,常用的是MFCC(Mel-scale Frequency Cepstral Coefficients)和Fbank(FilterBank),当然也可以使用……