基于深度神经网络的语音驱动发音器官的运动合成
2016-08-22唐郅侯进
自动化学报 2016年6期
唐郅 侯进
基于深度神经网络的语音驱动发音器官的运动合成
唐郅1侯进1
实现一种基于深度神经网络的语音驱动发音器官运动合成的方法,并应用于语音驱动虚拟说话人动画合成.通过深度神经网络(Deep neural networks,DNN)学习声学特征与发音器官位置信息之间的映射关系,系统根据输入的语音数据估计发音器官的运动轨迹,并将其体现在一个三维虚拟人上面.首先,在一系列参数下对比人工神经网络(Artificial neural network,ANN)和DNN的实验结果,得到最优网络;其次,设置不同上下文声学特征长度并调整隐层单元数,获取最佳长度;最后,选取最优网络结构,由DNN输出的发音器官运动轨迹信息控制发音器官运动合成,实现虚拟人动画.实验证明,本文所实现的动画合成方法高效逼真.
深度神经网络,语音驱动,运动合成,虚拟说话人
引用格式唐郅,侯进.基于深度神经网络的语音驱动发音器官的运动合成.自动化学报,2016,42(6):923-930
由于视觉与听觉是人类最主要、最便捷的两种沟通方式,因此虚拟人动画结合听视觉双模态沟通方式的特点,将虚拟人的视觉信息作为其声音的一种补充.例如,额外的舌头和唇部等发音器官的运动,眉毛和眼睑等面部特征,甚至是头部和肢体的动作等,这些附加信息可以极大提高虚拟人动画的真实感和可懂度.基于语音驱动虚拟人动画的方法已经被证实在人机交互应用中十分有效[1-5].
语音的产生与声道发音器官的运动直接相关,如唇部、舌头和……
登录APP查看全文
