基于语音驱动的虚拟形象合成系统
2021-03-16贺晓光
安徽电子信息职业技术学院学报 2021年1期
关键词:特征
贺晓光
(科大讯飞股份有限公司,安徽 合肥 230000)
一、引言
通过调研,我们发现有不少国内外学者对基于语音驱动的虚拟形象问题进行了深入研究。来自华盛顿大学的团队[1]在SIGGRAPH 2017上发布了合成奥巴马的论文,该方法采用RNN学习从原始音频特征到嘴型的映射,给定每个时刻的口型,通过纹理贴图的方法来合成高质量的嘴部纹理,接着使用动态规划算法将合成的嘴型和目标视频进行匹配和重定向使头部运动看起来更自然,最终将合成的嘴部区域融合进目标视频中。我们首先尝试了该方案,唇形预测和纹理合成后的嘴部区域效果很好,但是将合成嘴型和目标视频进行融合时,会出现明显的不匹配现象,通过多次调整参数,仍然很难得到论文中的效果。同时,我们认为仅考虑嘴部区域的合成而没有考虑下巴、法令纹附近肌肉的一致运动会使得融合结果过于生硬,自然度难以保证。
Zhou等人[2]提出的音频驱动虚拟动画人物的研究中,不仅考虑了嘴部区域的特征点还考虑了下巴、鼻子区域的部分特征点,这种方式给了我们一定的启发,我们也尝试采用该方式进行实验,效果虽然比仅用嘴部区域更好,但是合成出的视频部分时间段仍然存在明显地不自然。
以上的方法依赖于现有的3D模型,需要调节的参数也较多,经过较长时间的尝试,尚未得到较好的效果。因此,我们同时探索了直接使用2D图像进行视频生成的思路[3-4]。我们采用的思路是将使用语音预测出的唇形、鼻子点、下巴点连线画在对应的位置上,而将周围的RGB像素值置零,得到了输入图像,使用真实的RGB图像作为监督,让网络根据线框生成周围的纹理。……
登录APP查看全文
