APP下载

联合总变率空间和时延神经网络的说话人识别

2021-07-22瞿于荃邵玉斌杜庆治

计算机与生活 2021年7期
关键词:模型

瞿于荃,龙 华,2+,段 荧,邵玉斌,2,杜庆治,2

1.昆明理工大学 信息工程与自动化学院,昆明 650000

2.昆明理工大学 云南省计算机国家重点实验室,昆明 650000

说话人识别(speaker verification,SV)属于生物认证领域的一种技术,是一项根据说话人语音中代表说话人生理和行为的特征参数,来判别说话人身份的技术。起初的短语音问题还没能得到广大信号处理界的重视,有些研究员们仅仅从侧面提到了短语音问题[1],并未成为说话人识别的重点。由于说话人识别对样本语音的时长非常敏感,短时语音的识别性能的好坏,是决定其能否商业化的关键一步。随着说话人系统实际项目的落地,短语音问题开始被重视起来。由于实际生活环境的限制,收集目标用户长时间的语音数据不易,而在短语音条件下获得的有效信息较少,这样就无法提取足够的说话人身份信息,直接导致识别性能的降低。在21 世纪初期,高斯混合模型通用背景模型(Gaussian mixture model universal background model,GMM-UBM)[2]的提出解决了注册说话人语料不足的问题,它的成功应用标志着说话人识别的兴起。随后,联合因子分析(joint factor analysis,JFA)[3]则对说话人变率空间和信道变率空间分别建模,以其高性能引领了说话人识别进入一个新时代。继而,基于总变率空间的身份向量(identity vector,i-vector)[4]成为了近十年来说话人识别研究的基线标准。直至深度学习流行的今日,身份向量仍占据一席之地。近来,针对短语音说话人识别的问题,大致思路分为两方面。一是特征层面,增加特征有效维度是短语音的常用方法,它能有效提高识别率。……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用