一种改进高斯混合模型均值项的语音转换方法
2012-08-08赵义正
网络安全与数据管理 2012年19期
赵义正
(合肥电子工程学院,安徽 合肥 230037)
语音转换是指改变一个说话人(源说话人)的语音个性特征,使之具有另外一个说话人(目标说话人)的语音个性特征。语音转换技术的主要应用场合包括计算机语音合成、计算机语音翻译、语音编辑、广播及多媒体等方面。现阶段对语音的转换主要包含对韵律和谱包络的转换。谱包络转换方法有很多种,其中以基于高斯混合模型(GMM)[1]的映射方法效果最好,也是当前的主流方法。但是基于GMM的谱包络转换存在一个严重缺陷,即导致转换频谱的过平滑[2-4]。它会造成转换频谱的共振峰峰值特性下降,造成转换语音的听觉感知特性下降,影响转换效果。
对于造成过平滑的原因,一种观点(Toda)[4]认为,过平滑是由GMM模型中的统计平均运算造成的,另一种观点认为过平滑是由于转换函数中GMM的协方差估计不准确造成的[5],参考文献[6]认为过平滑主要是由于转换函数中的相关项引起的,并针对相关项进行改进以抑制过平滑现象。
由于GMM转换的特征可以分为均值项和相关项两部分,本文研究发现,过平滑产生是由两者共同导致的,而且均值项的影响更大。因此提出一种基于修正均值的语音转换方法,可更好地抑制过平滑现象。
1 基于高斯混合模型的语音转换函数及其分解
基于高斯混合模型的语音转换方法的转换函数可表示为:


式(1)可以改写成以下形式:


2 转换特征的标准差分析
转换后的频谱之所以会出现过平滑现象,是因为转换特征的离散程度较低,本文采用标准差来度量语音特征的离散度。……
登录APP查看全文
