[论文解读] Block shuffling learning for Deepfake Detection
本文提出了一种新型正则化方法——块混洗学习(Block Shuffling Learning, BSL),通过在空间维度上实施块内与块间混洗,实现跨空间维度的权重共享,从而增强深度伪造检测模型的泛化能力。结合对抗性损失与空间恢复机制,BSL提升了对未知伪造方法和常见图像变换的鲁棒性,在跨数据集评估中优于现有方法,并可无缝集成至多种CNN主干网络。
Deepfake detection methods based on convolutional neural networks (CNN) have demonstrated high accuracy. extcolor{black}{However, these methods often suffer from decreased performance when faced with unknown forgery methods and common transformations such as resizing and blurring, resulting in deviations between training and testing domains.} This phenomenon, known as overfitting, poses a significant challenge. To address this issue, we propose a novel block shuffling regularization method. Firstly, our approach involves dividing the images into blocks and applying both intra-block and inter-block shuffling techniques. This process indirectly achieves weight-sharing across different dimensions. Secondly, we introduce an adversarial loss algorithm to mitigate the overfitting problem induced by the shuffling noise. Finally, we restore the spatial layout of the blocks to capture the semantic associations among them. Extensive experiments validate the effectiveness of our proposed method, which surpasses existing approaches in forgery face detection. Notably, our method exhibits excellent generalization capabilities, demonstrating robustness against cross-dataset evaluations and common image transformations. Especially our method can be easily integrated with various CNN models. Source code is available at \href{https://github.com/NoWindButRain/BlockShuffleLearning}{Github}.
研究动机与目标
- 解决因依赖多样化伪造方法和图像变换带来的不稳定局部伪影而导致的深度伪造检测过拟合问题。
- 通过引入一种正则化机制,强制在空间维度上实现权重共享,而不改变像素值,从而提升模型泛化能力。
- 开发一种方法,在保持全局语义结构的同时,通过块混洗与恢复机制增强局部区域的特征学习能力。
- 确保在多种CNN架构(包括Xception、ResNet50和EfficientNet-B4)上的兼容性与性能提升。
- 通过引入对抗性损失组件,过滤由随机混洗操作引入的噪声,减轻其影响。
提出的方法
- 该方法将输入图像划分为非重叠的空间块,并对每一块内部执行块内混排,随机重排块内像素,以增强局部特征的鲁棒性。
- 引入对抗性损失,以抑制块内混排产生的噪声模式,提升模型区分真实与伪造特征的能力。
- 块间混排通过重新排列图像中各块的顺序,破坏全局空间结构,促使网络更依赖局部特征而非空间布局进行学习。
- 位置恢复模块用于重建原始块排列,以建模相邻块之间的语义关联,保留上下文信息。
- 框架采用端到端训练,采用多任务目标:伪造检测、块混排与位置恢复,其中可学习的超参数α与β用于平衡各项损失。
- 该方法与网络架构无关,可轻松集成至现有CNN主干网络,如Xception、ResNet50与EfficientNet-B4。
实验结果
研究问题
- RQ1块混洗正则化是否能在未知伪造方法和常见图像变换引发的分布偏移下,提升深度伪造检测的泛化能力?
- RQ2结合对抗性噪声过滤的块内混排,如何增强模型从局部不稳定伪造伪影中学习的能力?
- RQ3结合空间恢复的块间混排,在多大程度上提升了模型捕捉局部区域之间语义关系的能力?
- RQ4在检测准确率与恢复保真度之间取得平衡时,最优的块大小与超参数配置(α, β)为何?
- RQ5所提方法是否可在无需修改网络架构的前提下,有效迁移至不同CNN架构?
主要发现
- 在使用EfficientNet-B4作为主干网络的FF++ HQ数据集上,所提出的BSL方法检测AUC达到97.92%,超过基线模型的96.54%。
- 在FF++的低质量版本(LQ)上,BSL将检测AUC从基线模型的76.93%提升至85.61%,展现出对低质量图像的强大鲁棒性。
- 块间混排的最优块大小为32×32,更小的块会导致高层次语义信息丢失,从而降低性能。
- 超参数调优表明,α=1且β=1时检测性能最佳,当参数值过大或过小时性能显著下降。
- 该方法在不同架构间泛化良好,在ResNet50上AUC提升1.56%,在EfficientNet-B4上提升1.38%,均优于各自基线。
- 跨数据集评估结果表明,BSL在分布偏移下仍保持优异性能,表明其对未见伪造方法与图像变换具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。