[论文解读] Investigating the Impact of Pre-processing and Prediction Aggregation on the DeepFake Detection Task
本文提出了一种新颖的预处理流程,通过过滤误检的人脸并采用视频级别的预测聚合方法,提升多人脸视频中的DeepFake检测性能。该方法在基准数据集上的检测准确率最高提升2.2%,显著得益于训练数据质量的提升和稳健的聚合策略。
Recent advances in content generation technologies (widely known as DeepFakes) along with the online proliferation of manipulated media content render the detection of such manipulations a task of increasing importance. Even though there are many DeepFake detection methods, only a few focus on the impact of dataset preprocessing and the aggregation of frame-level to video-level prediction on model performance. In this paper, we propose a pre-processing step to improve the training data quality and examine its effect on the performance of DeepFake detection. We also propose and evaluate the effect of video-level prediction aggregation approaches. Experimental results show that the proposed pre-processing approach leads to considerable improvements in the performance of detection models, and the proposed prediction aggregation scheme further boosts the detection efficiency in cases where there are multiple faces in a video.
研究动机与目标
- 解决数据集预处理对DeepFake检测性能影响尚未被充分探索的问题。
- 通过后检测过滤机制减少误检人脸,提升训练数据质量。
- 开发并评估一种视频级别的预测聚合策略,以提升检测准确率,尤其在多人脸视频中表现更优。
- 探究DeepFake检测器在不同伪造类型和数据集之间的泛化能力限制。
- 通过将该流程集成到开源验证工具中,支持记者和公众在真实场景中的部署应用。
提出的方法
- 在人脸检测后应用预处理步骤,利用人脸相似度和连通组件分析来过滤误检结果。
- 通过特征嵌入计算检测到的人脸之间的成对相似度,并将相似的人脸分组为组件。
- 通过丢弃相似度较低或低于最小尺寸阈值的组件,移除误检。
- 采用基于组件置信度的加权投票机制,对帧级预测进行视频级别的聚合。
- 在三个基准数据集(Celeb-DF、FaceForensics++ 和 DFDC)上评估该方法,使用 EfficientNet-B4 及其他模型架构。
- 系统性地调整超参数,如相似度阈值(0.7–0.9)和最小组件尺寸(NF/4 至 3NF/4)。
实验结果
研究问题
- RQ1基于人脸相似度和组件分析的预处理对DeepFake检测性能有何影响?
- RQ2何种相似度与尺寸阈值组合能实现最有效的误检过滤?
- RQ3与帧级平均或最大池化相比,视频级别的预测聚合如何提升检测准确率?
- RQ4所提出的流程在不同DeepFake伪造类型和数据集之间具有多大程度的泛化能力?
- RQ5该预处理与聚合流程能否在真实世界的验证工作流中有效部署?
主要发现
- 所提出的预处理方法有效减少了误检的人脸,使 FaceForensics++ 数据集上的对数损失降低1.6%。
- 在 DFDC 测试集上,该方法实现了2.2%的对数损失降低,展现出显著的性能提升。
- Celeb-DF 数据集在最优阈值配置下实现1.6%的性能提升,其中相似度阈值为0.9时表现最佳。
- 采用 NF/4 的组件尺寸阈值可维持性能,而提升至 3NF/4 会导致结果下降,因过度移除有效组件。
- 预测聚合方案优于基线聚合方法,尤其在多人脸视频中,通过置信度加权投票机制实现更优表现。
- 研究发现检测器在未见伪造类型上的泛化能力有限,表明亟需更鲁棒、更具泛化能力的检测模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。