考虑帧间信息的语音转换算法
2012-11-26简志华王向文
杭州电子科技大学学报(自然科学版) 2012年4期
简志华,王向文
(杭州电子科技大学通信工程学院,浙江杭州310018)
0 引言
在语音信号中,说话人的个性特征是一种非常重要的信息。语音转换就是要改变源说话人语音的个性特征信息,使之具有目标说话人的个性信息,也即转换后的语音听起来就像是目标说话人的声音一样,但语音的语义内容保持不变[1]。早期的语音转换函数是基于矢量量化模型[2]。但基于矢量量化的转换算法由于将特征参数矢量离散化,导致频谱的不连续性,转换性能和语音质量都不理想。文献3提出了一种基于高斯混合模型(Gaussian Mixture Model,GMM)的具有连续形式的转换函数,具有较好的转换性能。文献4对GMM算法进行了改进,提出了联合矢量GMM模型,简化了运算,也使得基于GMM的转换算法逐渐地成为语音转换的主流算法。但由于基于GMM的转换函数是基于统计平均,使频谱过于平滑,导致转换后的语音质量和自然度下降。为了提高语音质量,文献5提出了一种基于频率卷绕的转换算法,具有较好的语音质量,但转换效果不佳。文献6综合了GMM转换算法和频率卷绕算法的优势,提出了一种在GMM模型的基础上进行加权的频率卷绕算法(Weighted Frequency Warping,WFW),较好地平衡了语音质量和转换性能之间的矛盾。但以上算法在转换时都没有考虑语音帧间的相关信息,而事实上,语音帧间具有很强的相关性,这些相关信息不仅有利于改善转换效果,也有利于提高转换后的语音质量。本文正是基于这一考虑,提出了采用压缩感知(Compressed Sensing,CS)理论[7]来考虑语音特征参数帧间相关信息的语音转换算法。……
登录APP查看全文
