APP下载

基于Tacotron 模型和韵律修正的情感语音合成方法

2022-08-13胡航烨曹欣怡

数据采集与处理 2022年4期
关键词:特征情感模型

张 昕,胡航烨,曹欣怡,王 蔚

(南京师范大学教育科学学院,南京 210097)

引 言

情感语音的合成逐步成为语音处理技术的热点方向,合成自然度高而且包含丰富情感信息的语音对实现更自然的人机交互有着重要意义。传统的合成方法主要有以下3 种:波形拼接法、韵律特征修改法以及基于隐马尔可夫模型(Hidden Markov model,HMM)的合成法。波形拼接的合成方法需要从大量的情感数据库中搜寻满足目标情感的音频片段,并根据一定的序列进行衔接,然而其语料库成本过高且语音片段拼接点处过于生硬,难以合成语料库之外的声音。韵律特征修改能有效改善合成语音情感缺乏的问题,却是以降低音频质量为代价。基于隐马尔可夫模型(Hidden Markov model,HMM)的方法,受人为干扰的影响较小,但由于其生成的是均值矢量参数序列,合成的声音过于平滑,无法有效表达需要的情感。深度学习算法的快速发展使语音合成领域的研究者们看到了希望,各类神经网络在语音合成中应用无需决策树聚类,便可从语言特征到声学特征转换的过程中学习到直接、分层和非线性的模型[1],快速提升合成语音的质量。如WaveNet[2]是基于PixelCNN 架构、在不增加计算成本的条件下使用带洞卷积直接生成语音波形的一种深度学习合成模型,其合成质量都优于传统方法,但计算量大仍然是其主要缺点,而且该模型未进行前端文本的改进处理。Char2Wav 整合了前端和后端,由神经声码器和读取器组成,直接从文本生成语音,但它使用的仍然是SampleRNN 神经声码器之前的预测声码器参数[3]。……

登录APP查看全文

猜你喜欢

特征情感模型
一半模型
如何在情感中自我成长,保持独立
重尾非线性自回归模型自加权M-估计的渐近分布
失落的情感
如何表达“特征”
情感
不忠诚的四个特征
如何在情感中自我成长,保持独立
3D打印中的模型分割与打包
线性代数的应用特征