[论文解读] A Note on Deepfake Detection with Low-Resources
该论文提出了一种适用于低资源环境的轻量化深度伪造检测方法,通过改进激活函数(特别是新型的Pish函数)增强MesoNet,并引入基于BRISK特征的局部特征描述符(LFD)方法。LFD方法在FaceForensics++数据集上实现了0.2836的等错误率(EER)、72.79%的准确率和70.12%的召回率;而Pish函数将MesoNet的准确率提升至0.8689,且表现高度一致,可在消费级设备的CPU上实现高效检测。
Deepfakes are videos that include changes, quite often substituting face of a portrayed individual with a different face using neural networks. Even though the technology gained its popularity as a carrier of jokes and parodies it raises a serious threat to ones security - via biometric impersonation or besmearing. In this paper we present two methods that allow detecting Deepfakes for a user without significant computational power. In particular, we enhance MesoNet by replacing the original activation functions allowing a nearly 1% improvement as well as increasing the consistency of the results. Moreover, we introduced and verified a new activation function - Pish that at the cost of slight time overhead allows even higher consistency. Additionally, we present a preliminary results of Deepfake detection method based on Local Feature Descriptors (LFD), that allows setting up the system even faster and without resorting to GPU computation. Our method achieved Equal Error Rate of 0.28, with both accuracy and recall exceeding 0.7.
研究动机与目标
- 开发可在低计算资源(如消费级CPU和GPU)上高效运行的深度伪造检测方法。
- 通过替代激活函数(包括新提出的Pish函数)提升MesoNet架构的性能与一致性。
- 探索并验证无需依赖深度神经网络的局部特征描述符(LFD),特别是BRISK和ORB,在深度伪造检测中的应用。
- 在保持高准确率和鲁棒性的同时,减少深度伪造检测的推理与训练时间。
- 为个人用户提供实用且可访问的解决方案,使其能够独立验证视频真实性,尤其适用于声誉损害或生物特征欺骗场景。
提出的方法
- 通过用替代激活函数(包括新提出的Pish函数)替换ReLU和LeakyReLU,增强MesoNet,以提升检测准确率与一致性。
- 提出一种新型激活函数Pish,旨在以极低计算开销提升模型性能。
- 开发基于局部特征描述符(LFD)的检测流程,使用BRISK和ORB关键点描述符,聚焦于坐标与角度信息,生成128维特征向量。
- 将每帧图像划分为16个相等的4×4空间块,基于关键点角度为每个块生成8-bin直方图,聚合为128维向量。
- 在FaceForensics++数据集上,对LFD向量训练支持向量机(SVM)分类器,未进行超参数调优以评估性能。
- 对比MesoNet(GPU加速)与LFD方法(纯CPU)的训练与推理时间,分别测量特征提取与分类耗时。
实验结果
研究问题
- RQ1替代激活函数是否能提升MesoNet架构在深度伪造检测中的准确率与一致性?
- RQ2所提出的Pish激活函数在检测性能与稳定性方面是否优于标准的ReLU和LeakyReLU?
- RQ3BRISK和ORB等局部特征描述符是否能在不使用深度神经网络的情况下实现具有竞争力的深度伪造检测性能?
- RQ4在纯CPU环境下,基于LFD的方法与MesoNet相比,其推理与训练时间如何?
- RQ5轻量化、基于CPU的深度伪造检测系统是否能达到足够高的准确率与低等错误率,从而适用于非专业用户的实际应用?
主要发现
- Pish激活函数将MesoNet的测试准确率提升至0.8689,优于基线ReLU+LeakyReLU组合(0.8676),并接近最先进模型性能。
- 基于BRISK描述符的LFD方法在FaceForensics++数据集上实现了0.2836的等错误率(EER),准确率为72.79%,召回率为70.12%。
- 与SURF相比,BRISK-based LFD方法将EER降低了0.09(从0.3917降至0.2836),与SIFT相比降低了0.046(从0.3395降至0.2836),表明其在所测试描述符中表现最优。
- 在CPU上训练LFD模型仅耗时3.5分钟,远低于MesoNet在消费级GPU上训练的30分钟,凸显其在低资源环境下的高效性。
- LFD方法的单帧推理时间为0.076秒,略高于MesoNet的0.034秒,主要因特征提取耗时占总时间的98%。
- 使用ORB描述符时准确率为70.59%,使用BRISK描述符时准确率达72.79%,表明描述符选择对检测性能有显著影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。