[论文解读] DeepfakeUCL: Deepfake Detection via Unsupervised Contrastive Learning
该论文提出 DeepfakeUCL,一种用于深度伪造检测的无监督对比学习方法,通过生成人脸图像的两个增强视图,利用对比损失学习不变特征,并使用编码器的特征进行下游线性分类。该方法在多个数据集上实现了与最先进监督方法相当的检测性能,甚至在具有挑战性的跨数据集基准测试中超越了部分监督模型。
Face deepfake detection has seen impressive results recently. Nearly all existing deep learning techniques for face deepfake detection are fully supervised and require labels during training. In this paper, we design a novel deepfake detection method via unsupervised contrastive learning. We first generate two different transformed versions of an image and feed them into two sequential sub-networks, i.e., an encoder and a projection head. The unsupervised training is achieved by maximizing the correspondence degree of the outputs of the projection head. To evaluate the detection performance of our unsupervised method, we further use the unsupervised features to train an efficient linear classification network. Extensive experiments show that our unsupervised learning method enables comparable detection performance to state-of-the-art supervised techniques, in both the intra- and inter-dataset settings. We also conduct ablation studies for our method.
研究动机与目标
- 为解决缺乏标注训练数据时深度伪造检测的挑战,因为获取标注数据成本高且耗时。
- 探索无监督对比学习是否能在无需标注样本的情况下学习到用于深度伪造检测的判别性特征。
- 评估所提方法在数据集内和跨数据集泛化设置下的有效性。
- 将无监督对比学习的性能与监督基线进行比较,并消融数据增强和特征提取层等关键组件的影响。
提出的方法
- 使用数据增强技术(包括随机裁剪、颜色抖动和随机灰度化)为单张人脸图像生成两个不同的增强视图。
- 将两个视图通过共享的编码器网络和投影头,利用对比损失最大化其表示的相似性。
- 对比学习目标促使模型为正样本对(同一图像的增强视图)生成一致的表示,同时将负样本对的表示相互推开。
- 在无监督预训练后,使用编码器的特征作为线性分类器的输入进行评估,避免端到端微调。
- 在三个基准数据集(FaceForensics++、UADFV 和 Celeb-DF)上使用 AUC 分数评估该方法。
- 通过消融实验比较无监督与监督对比学习、不同数据增强组合,以及编码器与投影头特征的实用性。
实验结果
研究问题
- RQ1无监督对比学习是否能在无需标注数据的情况下学习到用于深度伪造检测的判别性特征?
- RQ2在数据集内和跨数据集设置下,所提无监督方法的性能与最先进监督深度伪造检测技术相比如何?
- RQ3不同数据增强策略对所学习特征的鲁棒性和泛化能力有何影响?
- RQ4在深度伪造检测的下游线性分类中,编码器输出是否比投影头输出更有效?
主要发现
- 所提无监督对比学习方法在 UADFV 数据集上达到 93.3% 的 AUC,在 Celeb-DF 数据集上达到 90.5%,性能与最先进监督方法相当。
- 在更具挑战性的 Celeb-DF 数据集上,该方法在 AUC 上比在 UADFV 上微调的监督 Xception 模型高出 8.6%,达到 64.8%(测试时在 Celeb-DF 上)。
- 当在 UADFV 上训练并在 Celeb-DF 上测试时,该方法比使用三元组损失的监督对比学习基线高出 4.8% 的 AUC。
- 使用全部四种数据增强技术(随机裁剪、颜色抖动、随机灰度化和水平翻转)后,FaceForensics++ 的 AUC 提升至 59.0%,UADFV 的 AUC 提升至 85.6%,表明复杂增强策略的有益影响。
- 在下游线性分类中,编码器的特征始终优于投影头的特征,表明编码器学习到了更具判别性的表示。
- 消融实验确认无监督对比学习有效,且随着数据增强复杂度的提高,性能持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。