[论文解读] Spatiotemporal Inconsistency Learning for DeepFake Video Detection
本文提出了一种用于深度伪造视频检测的新颖空间-时间不一致性学习(STIL)模块,通过水平和垂直时间差分操作显式建模帧内的空间不一致性以及相邻帧间的时间不一致性。STIL模块集成了空间不一致性模块(SIM)、具有正交方向建模能力的时间不一致性模块(TIM)以及用于特征融合的信息补充模块(ISM),通过有效捕捉帧级或标准视频级方法常遗漏的伪造痕迹,在多个基准测试中实现了最先进性能。
The rapid development of facial manipulation techniques has aroused public concerns in recent years. Following the success of deep learning, existing methods always formulate DeepFake video detection as a binary classification problem and develop frame-based and video-based solutions. However, little attention has been paid to capturing the spatial-temporal inconsistency in forged videos. To address this issue, we term this task as a Spatial-Temporal Inconsistency Learning (STIL) process and instantiate it into a novel STIL block, which consists of a Spatial Inconsistency Module (SIM), a Temporal Inconsistency Module (TIM), and an Information Supplement Module (ISM). Specifically, we present a novel temporal modeling paradigm in TIM by exploiting the temporal difference over adjacent frames along with both horizontal and vertical directions. And the ISM simultaneously utilizes the spatial information from SIM and temporal information from TIM to establish a more comprehensive spatial-temporal representation. Moreover, our STIL block is flexible and could be plugged into existing 2D CNNs. Extensive experiments and visualizations are presented to demonstrate the effectiveness of our method against the state-of-the-art competitors.
研究动机与目标
- 解决现有深度伪造检测方法中对空间与时间不一致性缺乏显式建模的问题。
- 通过捕捉跨帧中视觉上不自然的伪造痕迹(如面部抖动或运动不连续)来提升检测性能。
- 设计一种兼容2D卷积神经网络的灵活、即插即用模块,以增强空间与时间特征学习能力。
- 验证正交时间差分操作(水平与垂直方向)在检测伪造视频中时间不一致性方面的有效性。
- 证明联合建模空间与时间不一致性可带来更鲁棒、更全面的伪造表征。
提出的方法
- 提出一种新颖的STIL模块,集成三个组件:空间不一致性模块(SIM),用于检测每帧内的局部图像级伪影。
- 引入时间不一致性模块(TIM),通过在相邻帧间沿水平与垂直方向计算时间差分,以检测运动不连续性。
- 采用双流架构,SIM与TIM并行处理空间不一致性和时间不一致性。
- 利用信息补充模块(ISM)融合并增强来自SIM与TIM的特征,实现更丰富的时空表征。
- 应用基于梯度的可视化方法(Grad-CAM)以解释注意力图,并验证模型对伪造区域的关注程度。
- 采用仅使用视频级别标签的训练范式,实现端到端学习,无需帧级标注。
实验结果
研究问题
- RQ1显式建模空间与时间不一致性是否能超越帧级或标准视频级方法,提升深度伪造检测性能?
- RQ2使用正交时间差分操作(水平与垂直方向)是否能增强对伪造视频中时间不一致性的检测能力?
- RQ3通过ISM融合空间与时间特征如何提升整体检测性能?
- RQ4STIL模块能否在多种人脸操作技术(如DeepFake、FaceSwap、Face2Face与NeuralTextures)上实现良好泛化?
- RQ5各组件(SIM、TIM、ISM)对最终检测性能的贡献如何?不同特征融合策略对结果有何影响?
主要发现
- STIL模块在四个主要深度伪造检测基准上实现了最先进性能,优于现有帧级与视频级方法。
- 消融实验表明,TIM中同时使用水平与垂直方向时间差分操作相比单方向或其它融合策略,能取得更优性能。
- 通过ISM融合空间与时间特征可显著提升检测准确率,证明了联合时空建模的优势。
- 可视化结果表明,STIL模块能有效定位不同操作类型下的伪造区域,注意力图与已知伪造模式高度对齐。
- 该方法在多种操作技术中均表现出一致的性能提升,包括仅伪造面部局部区域的类型(如NeuralTextures与Face2Face)。
- 在TIM中简单平均水平与垂直方向的注意力图,优于在Sigmoid前进行求和,表明该融合策略为最优选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。