Skip to main content
QUICK REVIEW

[论文解读] Deepfake Video Detection with Spatiotemporal Dropout Transformer

Daichi Zhang, Fanzhao Lin|arXiv (Cornell University)|Jul 14, 2022
Digital Media Forensic Detection被引用 4
一句话总结

该论文提出了一种基于补丁级别的深度伪造视频检测框架——时空丢弃视觉Transformer(STD-Former),该框架将面部视频帧重新组织为非重叠补丁的集合,并将其输入视觉Transformer(ViT)以实现鲁棒的表征学习。一种新颖的时空丢弃操作——随机移除帧和补丁——通过利用伪造视频中的动态时空不一致性,增强了模型的泛化能力和鲁棒性,在多个基准测试中实现了最先进性能,相较于ViT主干网络平均准确率提升11.15%。

ABSTRACT

While the abuse of deepfake technology has caused serious concerns recently, how to detect deepfake videos is still a challenge due to the high photo-realistic synthesis of each frame. Existing image-level approaches often focus on single frame and ignore the spatiotemporal cues hidden in deepfake videos, resulting in poor generalization and robustness. The key of a video-level detector is to fully exploit the spatiotemporal inconsistency distributed in local facial regions across different frames in deepfake videos. Inspired by that, this paper proposes a simple yet effective patch-level approach to facilitate deepfake video detection via spatiotemporal dropout transformer. The approach reorganizes each input video into bag of patches that is then fed into a vision transformer to achieve robust representation. Specifically, a spatiotemporal dropout operation is proposed to fully explore patch-level spatiotemporal cues and serve as effective data augmentation to further enhance model's robustness and generalization ability. The operation is flexible and can be easily plugged into existing vision transformers. Extensive experiments demonstrate the effectiveness of our approach against 25 state-of-the-arts with impressive robustness, generalizability, and representation ability.

研究动机与目标

  • 为解决现有图像级深度伪造检测方法忽略时间线索且难以泛化至多样化深度伪造生成技术的局限性。
  • 通过将视频输入重新组织为补丁级表征,利用帧间局部面部区域的时空不一致性——深度伪造伪影的关键指标。
  • 设计一种灵活、可插拔的时空丢弃(STD)机制,通过有效的数据增强和改进的特征学习,提升基于ViT的模型性能。
  • 在多样化深度伪造数据集上实现优越的检测性能,具备强大的泛化能力与对未见生成方法的鲁棒性。

提出的方法

  • 首先将输入视频提取为面部帧序列,然后将每帧划分为非重叠的网格状面部补丁,形成补丁集合。
  • 将补丁集合输入视觉Transformer(ViT),以学习帧与补丁之间时空线索的判别性、鲁棒表征。
  • 引入一种时空丢弃(STD)操作:首先进行时间丢弃,随机移除序列中的帧;随后进行空间丢弃,从剩余帧中随机丢弃补丁。
  • 由此产生的缩减补丁集合在保持完整面部覆盖的同时,暴露了时间维度上局部区域的不一致性,增强了模型对深度伪造伪影的敏感性。
  • STD的随机特性为每段视频生成多样化的训练实例,有效作为数据增强手段,提升泛化能力与鲁棒性。
  • 该STD操作与架构无关,可无缝集成至现有视觉Transformer模型中。

实验结果

研究问题

  • RQ1建模帧间补丁级别的时空不一致性是否能超越帧级分析,提升深度伪造视频检测性能?
  • RQ2时空丢弃机制在提升深度伪造检测模型鲁棒性与泛化能力方面的有效性如何?
  • RQ3所提出的STD-Former框架是否在多样化深度伪造数据集与生成技术上均优于最先进方法?
  • RQ4如时间与空间丢弃率等超参数如何影响检测性能?
  • RQ5该STD操作在不同ViT架构上的泛化能力如何?

主要发现

  • 所提出的时空丢弃(S+T)变体性能最高,相较于仅使用空间或时间丢弃的变体,准确率与AUC均更高,证明了联合时空建模的必要性。
  • 最优丢弃率被确定为α = 1/4(时间丢弃率)和β′ = 1/18(空间丢弃率),当率过高或过低时性能均下降。
  • 在Celeb-DF(v2)数据集上,与无STD的基线模型相比,STD-Former在四个ViT主干网络(ViT-B16, ViT-B32, ViT-L16, ViT-L32)上平均准确率提升11.15%,AUC提升7.76%。
  • 该方法在25个基准测试中达到最先进性能,展现出对多样化深度伪造生成方法的强大泛化能力与鲁棒性。
  • 消融实验确认,STD操作显著提升了模型的鲁棒性与泛化能力,且在不同ViT架构与网络设计中均保持一致的性能提升。
  • 当使用相同丢弃变体时,该方法优于强基线模型(TD-3DCNN),进一步验证了所提出STD机制的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。