基于Inception3D网络的眼部与口部区域协同视频换脸伪造检测
2021-04-19韩语晨张海剑
韩语晨 华 光 张海剑
(武汉大学电子信息学院, 湖北武汉 430072)
1 引言
深度伪造(DeepFake),即利用深度学习技术合成虚假图像、视频、音频等多媒体内容,作为新兴的多媒体内容篡改方式,是目前受社会各界关注最为广泛且负面影响深远的安全隐患之一[1-2]。较传统手工伪造多媒体(借助Photoshop、Audacity等媒体编辑软件),深度伪造多媒体具有伪造内容自由度更高、伪造效果更逼真、人眼更难察觉等显著优势。深度伪造多媒体往往含有虚假的人物、事件及语音资料,一旦在网络空间大范围快速传播,可被利用于散布虚假信息、诱导舆情发展、制造传播仇恨、煽动群体行为,对个人、集体乃至国家安全造成严重损害。2018年,网络上出现美国前总统奥巴马发表不当言论(对其后一任总统特朗普进行人身攻击)的视频[3],经证实是利用深度伪造技术产生的虚假视频。2019年,新华网披露目前微信诈骗科技含量越来越高,已出现通过深度伪造的克隆语音进行成功诈骗的案例[4]。此外,开源的“换脸”、“换声”等程序层出不穷,且不乏“一键式”深度伪造软件和手机App,使得深度伪造的“门槛”大幅降低,也使深度伪造多媒体内容取证成为亟待研究的世界性课题。
伪造视频中对面部信息的篡改主要可以分为四种类型[5]:
整脸合成(Entire Face Synthesis):整脸合成指通过深度伪造技术合成现实世界不存在的人脸,主要分为基于生成对抗网络(generative adversarial network,GAN)[6]和自编码器(autoencoder)[7]的方法。目前较有代表性的方法为文献[8]中提出的StyleGAN,2020年11月,韩国MBN电视台成功运用该技术合成了第一位AI主播,实现了智能新闻播报[9]。……
