基于特征相对贡献度对加权Mel倒谱的改进
2021-07-14王家盛郭其威马建敏
王家盛,郭其威,吴 松,马建敏
(1. 复旦大学航空航天系,上海200433;2. 上海宇航系统工程研究所,上海201109)
0 引 言
声纹识别技术是生物识别技术的一种,借助人体生物特征或者行为特征对身份进行识别。与其他生物识别技术相比,说话人识别具有简便经济,隐藏性高以及获取成本廉价等优势,可广泛应用于公共安全、金融服务、智能硬件等应用场景。
在声纹识别中,影响识别率最大的就是特征参数的提取与选择。目前主流的说话人特征主要是提取以梅尔倒谱系数(Mel Frequency Cepstrum Coefficient, MFCC)为代表的基于人耳听觉感知特性的特征参数,类似的特征还有伽马通频率倒谱系数(Gammatone Frequency Cepstral Coefficients, GFCC)、耳蜗滤波器特征参数(Cochlear Filter Cepstral Coefficients, CFCC)等。其中,在大量的实验中已证实MFCC具有优异的识别率表现,故对MFCC特征参数的优化与改进一直都是说话人识别研究中的重点。目前以优化特征的方式去改善声纹识别性能的研究,主要可分为三个方向,即针对特征提取过程的改进、特征融合以及差异化特征分量。
在MFCC的提取过程中,实际上存在许多的简单设定,并不能很好地模拟人耳听觉效应。如传统的傅里叶变换仅能提供2π/N等分的固定频率分辨率,单个三角带通滤波器呈中心对称分布等。张怡然等通过引入多窗谱估计代替传统的加汉明窗求频谱的操作,减少了频谱估计的方差值,能使特征更好地反映出声道的结构[1]。章熙春等将弯折傅里叶变换(Wrapped Discrete Fourier transform, WDFT)应用到MFCC特征中以提高低频段的频率分辨率[2],邓蕾等采用弯折滤波器组(Warped Filter Banks,WFBS)基于人耳基底膜感知频率群在低频处密集、高频处宽松的分布特性,更好地模拟出人耳的听觉机理[3]。……
