APP下载

基于深度学习的开放场景下声纹识别系统的设计与实现

2021-12-06郭新罗程方邓爱文

南京信息工程大学学报 2021年5期
关键词:特征提取特征模型

郭新 罗程方 邓爱文

0 引言

声纹作为生物特征识别中的一种行为特征,因其蕴含丰富的个人信息,比如性别、年龄、情绪、语种等,被作为身份识别的一种方式,且因其伪造难度高、隐私性弱、辨识性强等优势,近些年来引起了业界广泛的关注.2018年被称为“声纹元年”,是声纹技术迈向产业化的重要转折点,这一年,中国人民银行发布了《移动金融基于声纹识别的安全应用技术规范》(JRT0164—2018)[1].声纹识别技术在国内正逐渐被应用于金融、社保、公安、智能家居等重要领域.

在学术界,声纹识别又称说话人识别,它是提取语音信号中能够表征说话人个性特征的信息,利用传统机器学习或深度学习,自动地实现说话人身份识别的一种生物特征识别技术.声纹识别(Speaker Recognition,SR)分为声纹辨认(Speaker Identification,SI)和声纹确认(Speaker Verification,SV)[2],其中声纹辨认是1∶n任务,声纹确认是1∶1任务,本文算法主要是基于SV的,整个系统的实现是两者兼有.目前,说话人识别应用的痛点是短时语音和基于开放环境的噪声影响,这就是本文的主要研究内容之一.

20世纪90年代,声纹识别最经典的模型是GMM-UBM模型及i-vector,在深度学习之前,它们一直是占据业界的主流技术.近些年来深度学习下的声纹研究已呈现愈来愈繁荣的局面,从深度卷积网络下的d-vector技术到x-vector技术[3],尤其x-vector是当前声纹领域中主流的模型框架.x-vector框架下的主要研究内容包括声音预处理、特征提取层、特征编码层和损失函数的优化.对于声音预处理,常用的是MFCC(Mel-scale Frequency Cepstral Coefficients)和Fbank(FilterBank),当然也可以使用……

登录APP查看全文

猜你喜欢

特征提取特征模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
基于Gazebo仿真环境的ORB特征提取与比对的研究
不忠诚的四个特征
一种基于LBP 特征提取和稀疏表示的肝病识别算法
3D打印中的模型分割与打包
基于MED和循环域解调的多故障特征提取
线性代数的应用特征
Walsh变换在滚动轴承早期故障特征提取中的应用