[论文解读] A Hybrid CNN-LSTM model for Video Deepfake Detection by Leveraging Optical Flow Features
该论文提出了一种结合光学流特征的混合CNN-LSTM模型,通过捕捉视频的时空不一致性来检测深度伪造视频。通过利用光学流提取运动动态,并将其与CNN-LSTM结合进行分类,该模型在FF++数据集上实现了91.21%的准确率,在Celeb-DF数据集上实现了79.49%的准确率,且仅使用70帧或更少的帧数,实现了计算负载较低的早期检测。
Deepfakes are the synthesized digital media in order to create ultra-realistic fake videos to trick the spectator. Deep generative algorithms, such as, Generative Adversarial Networks(GAN) are widely used to accomplish such tasks. This approach synthesizes pseudo-realistic contents that are very difficult to distinguish by traditional detection methods. In most cases, Convolutional Neural Network(CNN) based discriminators are being used for detecting such synthesized media. However, it emphasise primarily on the spatial attributes of individual video frames, thereby fail to learn the temporal information from their inter-frame relations. In this paper, we leveraged an optical flow based feature extraction approach to extract the temporal features, which are then fed to a hybrid model for classification. This hybrid model is based on the combination of CNN and recurrent neural network (RNN) architectures. The hybrid model provides effective performance on open source data-sets such as, DFDC, FF++ and Celeb-DF. This proposed method shows an accuracy of 66.26%, 91.21% and 79.49% in DFDC, FF++, and Celeb-DF respectively with a very reduced No of sample size of approx 100 samples(frames). This promises early detection of fake contents compared to existing modalities.
研究动机与目标
- 解决现有深度伪造检测方法主要关注空间特征而忽略视频序列中时间不一致性的局限性。
- 通过整合捕捉帧间运动动态(尤其是深度伪造中常见的面部运动异常)的光学流特征,提升检测性能。
- 开发一种轻量化、计算效率高的模型,通过仅处理有限数量的视频帧(≤100帧)实现早期检测。
- 在低帧数条件下,评估模型在DFDC、FF++和Celeb-DF等多样化深度伪造数据集上的鲁棒性。
- 证明通过光学流进行时间建模相比仅依赖空间特征的模型,能显著提升检测准确率。
提出的方法
- 使用传统计算机视觉方法从视频帧中提取光学流,以量化连续帧之间的像素级运动,捕捉时间不一致性。
- 使用预训练的VGG16 CNN从每帧中提取空间特征,随后进行光学流特征提取,以表征运动模式。
- 将空间特征与运动特征拼接后输入堆叠的LSTM网络,以建模序列依赖关系并检测时间异常。
- 端到端训练混合CNN-LSTM架构,通过反向传播损失优化真实与伪造视频的分类。
- 使用多种指标(准确率、精确率、召回率、F1-score和AUC)在三个基准数据集(DFDC、FF++和Celeb-DF)上评估模型性能。
- 为降低计算成本,实验在帧子集(≤100帧)上进行,消融实验表明随着帧数增加,性能有所提升。
实验结果
研究问题
- RQ1光学流特征是否能通过捕捉空间模型所忽略的帧间运动不一致性,提升深度伪造检测性能?
- RQ2与独立模型相比,CNN与LSTM架构的融合在深度伪造检测中如何增强时间建模能力?
- RQ3该混合CNN-LSTM模型在有限帧数下能实现多高的检测准确率?
- RQ4在多样化深度伪造数据集上,该方法在准确率、F1-score和AUC方面与最先进方法相比表现如何?
- RQ5使用光学流是否能通过在更短视频片段上实现有效分析,实现深度伪造的更早检测?
主要发现
- 在FF++数据集上,该模型仅使用每视频最多70帧,即实现91.21%的准确率、91.20%的F1-score和0.91的AUC。
- 在Celeb-DF数据集上,该模型在最多70帧下达到79.49%的准确率、78.80%的F1-score和0.79的AUC。
- 在DFDC数据集上,该模型在最多40帧下实现66.26%的准确率、65.35%的F1-score和0.66的AUC。
- 即使使用的帧数远少于以往研究,该模型在F1-score和AUC等关键指标上仍优于或匹配最先进方法。
- 通过整合光学流特征,显著提升了检测性能,因其能捕捉空间模型所缺失的运动伪影。
- 结果表明,早期深度伪造检测具有可行性,因为该模型在短视频片段上仍保持强劲性能,显著降低了计算需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。