[论文解读] Mover: Mask and Recovery based Facial Part Consistency Aware Method for Deepfake Video Detection
Mover 提出了一种两阶段深度伪造检测方法,通过遮罩和恢复面部感兴趣区域(ROIs)来利用非特定的面部部位一致性。它在真实人脸图像上预训练一个掩码自编码器,以学习部位级别的连贯性,然后使用双分支网络——一个微调用于不一致性检测,另一个基于重建的映射网络——在不同数据集上实现对真实与伪造视频的高鲁棒性区分。
Deepfake techniques have been widely used for malicious purposes, prompting extensive research interest in developing Deepfake detection methods. Deepfake manipulations typically involve tampering with facial parts, which can result in inconsistencies across different parts of the face. For instance, Deepfake techniques may change smiling lips to an upset lip, while the eyes remain smiling. Existing detection methods depend on specific indicators of forgery, which tend to disappear as the forgery patterns are improved. To address the limitation, we propose Mover, a new Deepfake detection model that exploits unspecific facial part inconsistencies, which are inevitable weaknesses of Deepfake videos. Mover randomly masks regions of interest (ROIs) and recovers faces to learn unspecific features, which makes it difficult for fake faces to be recovered, while real faces can be easily recovered. Specifically, given a real face image, we first pretrain a masked autoencoder to learn facial part consistency by dividing faces into three parts and randomly masking ROIs, which are then recovered based on the unmasked facial parts. Furthermore, to maximize the discrepancy between real and fake videos, we propose a novel model with dual networks that utilize the pretrained encoder and masked autoencoder, respectively. 1) The pretrained encoder is finetuned for capturing the encoding of inconsistent information in the given video. 2) The pretrained masked autoencoder is utilized for mapping faces and distinguishing real and fake videos. Our extensive experiments on standard benchmarks demonstrate that Mover is highly effective.
研究动机与目标
- 解决现有深度伪造检测方法依赖特定伪造模式或显式线索的局限性,这些方法在面对新型操作技术时性能下降。
- 利用真实人脸中固有的面部部位一致性(如眼睛、嘴巴和眉毛之间和谐的表情)作为通用的、非特定的信号,用于检测深度伪造。
- 开发一种方法,通过避免依赖人工设计的特征或特定伪造伪影,实现在未见数据集和伪造技术上的良好泛化能力。
- 通过元学习和人脸重建提升跨数据集检测性能,以放大真实与伪造人脸之间的差异。
提出的方法
- 通过将人脸划分为语义区域(如眼睛、嘴巴)并随机遮罩感兴趣区域(ROIs),然后利用未遮罩部分重建被遮罩区域,在真实人脸图像上预训练一个掩码自编码器(MAE),以学习面部部位一致性。
- 采用双分支网络架构:一个分支微调预训练编码器以检测视频帧中的不一致特征,另一个分支使用预训练的 MAE 进行人脸重建并分类视频。
- 在映射网络中集成元学习模块,以在训练期间模拟跨域检测,提升域泛化能力。
- 在映射网络中将人脸重建作为关键组件,以放大真实与伪造人脸之间的差异,使不一致性更易检测。
- 利用类激活映射(CAM)可视化注意力,确认模型聚焦于伪造人脸中的不一致区域,尤其是被遮罩区域。
- 采用两阶段端到端训练:首先仅在真实图像上进行预训练,然后在真实和伪造视频数据上进行微调,以最大化判别能力。
实验结果
研究问题
- RQ1面部部位一致性能否作为深度伪造检测的通用、非特定信号,在伪造模式演变时仍保持有效性?
- RQ2与整体人脸重建相比,基于语义区域的遮罩与恢复面部部位在多大程度上提升了检测鲁棒性?
- RQ3双网络设计(结合不一致性检测与基于重建的映射)在多大程度上提升了检测性能和跨数据集泛化能力?
- RQ4在重建分支中集成元学习是否能提升对未见深度伪造数据集的域泛化能力?
- RQ5人脸重建是否能放大真实与伪造人脸之间的差异,特别是在面部部位不一致性较细微的情况下?
主要发现
- Mover 在标准基准测试中达到最先进性能,在跨数据集和跨数据集检测设置下均优于现有方法。
- 消融实验表明,若移除微调网络或映射网络,性能显著下降,证明两个分支对最优检测均不可或缺。
- 元学习模块通过在训练期间模拟域偏移,提升了跨数据集检测能力,其泛化性能优于无元学习的变体。
- 映射网络中的重建过程放大了真实与伪造人脸之间的检测差异,相较于无重建的方法,性能提升明显。
- 可视化结果表明,模型因不一致性而激活伪造人脸中的被遮罩区域,而真实人脸则在背景区域激活,证实其对部位级和谐性的敏感性。
- 与 RECCE 和原始 MAE 相比,Mover 生成了更清晰、更具语义引导性的重建结果,尤其在可视化中黄色框区域突出显示了不一致的面部区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。