基于卷积LSTM 的视频中Deepfake 检测方法
2021-04-20李永强
李永强,白 天
(中国科学技术大学 软件学院,安徽 合肥230026)
0 引言
近年来,基于深度学习技术的图像生成技术迅速发展,视频人脸伪造技术也随之日趋成熟。 利用此类技术的人脸伪造技术已经可以欺骗普通人类[1]。但这些技术的滥用也引发了一些社会问题,因为这些技术可以利用公众人物公开的视频、图像素材,伪造公众人物出场的虚假视频,发布虚假的言论,或伪造色情影片,破坏名誉。 由于Deepfakes 项目[2]的广泛流传,这一类技术常被通称为Deepfake。 为了避免Deepfake 技术的滥用,许多研究团体做出了卓越的贡献。 ROSSLER A 等人发布了包含大量Deepfake 数据的公开数据集FaceForensics++[1],以帮助研究人员研究检测算法。 Facebook 开展了DFDC(Deepfake Detection Challenge)比赛并公布了训练数据集[3]。
早期的研究主要是从视频中随机提取帧,使用基于卷积神经网络(Convolutional Neural Networks,CNN)的二分类器进行检测[1]。 这样的方法存在两个问题。一是只使用了单帧信息,忽略了Deepfake 技术的动态缺陷,在低质量场景下容易出错。 二是分类器与训练数据高度相关,不具备通用性,在对数据的生成模型未知的情况下,效果将会大打折扣。
另外有研究从频域角度出发试图解决问题。KORSHUNOV P[4]等人通过构造图片的频率特征或统计特征等方法,构造图像质量指标(Image Quality Measures,IQM),作为特征供支持向量机(Support Vector Machine,SVM)学习,但是通过构造特征的方式需要大量专业知识,不能很好地泛化问题。 QIAN Y[5]等人从频域提取到Deepfake 模型留下的特定频率特征,在特定数据集上获得了较好的效果。 然而无法保证不同的模型能产生类似的频率特征,并且不同的有损压缩方式也会带来频率噪声,对频域特征存在干扰,缺乏鲁棒性。……
