多项式函数拟合实现汉语声调的语音合成
2021-06-17李建文王咿卜
西安科技大学学报 2021年3期
李建文,王咿卜
(陕西科技大学 电子信息与人工智能学院,陕西 西安 710021)
0 引 言
语音是人与人传递信息和表达情感最有效的方式之一。中国汉字大约有十万个,是一种独特的声调表意语言[1-2]。在计算机对字符进行编码过程中,汉字在众多语言中所占存储空间最大,导致编码过程中极为不便,但若从拼音角度出发,按不同声调对汉字进行归类,却可以把汉字数目缩减到约原始容量的1/4,极大的缩减了工作量且保证了语音的逼真度。在如今人工智能高速发展的时代,语音识别及语音合成要做的不仅是算法准确度的提高,更应该注重其智能化和逼真度[3-4]。语音识别与合成的结果固然重要,但忽略了不同情景下语音相关合适声调的选择,就难以真正实现智能化。个性化的语音合成,需要把话语中声调所表达的情感状态作为考察的特征之一[5-8]。同样的语言,不同环境、情绪,会使语音发出者使用不同声调。在医学中,针对听力障碍者推出的人工耳蜗产品也并未考虑声调、语调等特征的感知[1-2]。因此,从数学角度出发,考虑汉语4种声调的特征参数以及之间参数的变换很有必要。
刘梦媛设计了基于HMM的语音合成系统,选取缅甸语事物声母及带声调事物韵母作为合成基元,解决了变音和变调问题[9];王国梁设计了端到端的语音合成系统Tacotron 2,在语料不足的情况下使用预训练解码器,并通过多层感知机代替变线性变化对停止符进行预测[10];宋刚基于Target模型进行语调分析,总结了4种声调的基频曲线变化规律,采用分段拟合方法,将各个声调分为两段来研究,拟合过程中所需特征参数有各段音调的斜率、音高变化的调域及所占时间[11];……
登录APP查看全文
