APP下载

基于MRACC 特征的鲁棒说话人识别研究

2021-02-25夏秀渝

智能计算机与应用 2021年10期
关键词:特征实验模型

崔 潇, 夏秀渝

(四川大学 电子信息学院, 成都 610065)

0 引 言

近年来,说话人识别的研究获得了迅速发展,在军事、信息安全和通信等领域都有广泛应用[1]。 在现实环境中,由于噪声的存在,导致说话人系统的识别率显著下降。 因此如何提高系统在噪声环境下的识别性能成为研究热点。

在特征提取方面,常用的说话人识别特征有梅尔频率倒谱系数(Mel Frequency Cepstral Coefficient,MFCC)[2]、线性预测倒谱系数(Linear Prediction Cepstral,LPCC)[3]等。 通过对Gammatone 滤波器的研究,Chen 等人[4]提出多分辨率耳蜗图(Multiresolution cochleagram,MRCG),相较于MFCC 和LPCC 特征,则具有更好的抗噪性能。

随着机器学习算法的发展,神经网络被用于说话人识别中,杨瑶等人[5]使用误差反向传播(Back Propagation,BP)网络进行文本无关的说话人识别研究。 盖晁旭[6]利用稀疏(Sparse Autoencoder,SA)提取说话人特征进行说话人识别,循环神经网络(Recurrent Neural Networks,RNN)具有记忆功能,处理时序数据的能力较强。 目前, Hochreiter 和Schmidhuber 提出的长短时记忆网络[7](Long Short Term Memory,LSTM)是应用最广泛的RNN 网络之一。 LSTM 网络在处理时间范围较大的信息时具有更好的性能,被用于语种识别[8]、语音识别[9]、音素分类[10]、唇语识别[11]等多个领域中。

本文构建了基于MRACC 特征的说话人识别系统。 在噪声环境下,首先使用文中提出的改进型谱减法完成语音的预降噪处理,接着提取基于多分辨率耳蜗图的MRACC 特征,最后将特征参数输入到LSTM 网络中实现模型的训练与匹配,通过实验验证了本文提出的说话人识别方法的有效性。

1 说话人识别系统

本文的说话人识别系统框图如图1 所示。 主要包含预处理、特征提取、模型训练、模型匹配和决策判决五个模块。……

登录APP查看全文

猜你喜欢

特征实验模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
做个怪怪长实验
不忠诚的四个特征
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
线性代数的应用特征