[论文解读] How Do the Hearts of Deep Fakes Beat? Deep Fake Source Detection via Interpreting Residuals with Biological Signals
本文提出了一种新颖的深度伪造源检测方法,利用生物信号——特别是从面部区域提取的光电容积脉搏波(PPG)——来解析生成模型的残差。通过将时空PPG模式编码为PPG单元,并使用预训练的卷积神经网络进行分类,该方法在虚假/真实检测中达到97.29%的准确率,在源生成模型识别中达到93.39%的准确率,优于现有方法,同时能够检测未见过的生成器。
Fake portrait video generation techniques have been posing a new threat to the society with photorealistic deep fakes for political propaganda, celebrity imitation, forged evidences, and other identity related manipulations. Following these generation techniques, some detection approaches have also been proved useful due to their high classification accuracy. Nevertheless, almost no effort was spent to track down the source of deep fakes. We propose an approach not only to separate deep fakes from real videos, but also to discover the specific generative model behind a deep fake. Some pure deep learning based approaches try to classify deep fakes using CNNs where they actually learn the residuals of the generator. We believe that these residuals contain more information and we can reveal these manipulation artifacts by disentangling them with biological signals. Our key observation yields that the spatiotemporal patterns in biological signals can be conceived as a representative projection of residuals. To justify this observation, we extract PPG cells from real and fake videos and feed these to a state-of-the-art classification network for detecting the generative model per video. Our results indicate that our approach can detect fake videos with 97.29% accuracy, and the source model with 93.39% accuracy.
研究动机与目标
- 为解决深度伪造检测中的关键空白,不仅识别视频是否为伪造,还确定其由哪个生成模型生成。
- 探索生物信号(如PPG)是否可作为生成模型残差的可解释投影。
- 开发一种计算高效且可泛化的检测框架,同时提升真实性判断与源分类性能。
- 通过学习生物信号空间中独特的残差特征,实现对先前未见生成器的检测。
提出的方法
- 从视频帧序列中的面部区域提取32个原始PPG信号,以捕捉与血流和脉搏相关的血流动力学变化。
- 通过编码面部区域和时间窗口内PPG信号的振幅与功率谱密度,构建时空PPG单元。
- 将PPG单元输入预训练的深度神经网络(例如VGG19、DenseNet201)以分类视频的源生成模型。
- 通过平均对数似然值聚合视频窗口内各帧的预测结果,生成最终的视频级分类结果。
- 在FaceForensics++数据集上进行训练,使用数据增强,并采用多分类交叉熵损失进行源识别。
- 通过消融研究并在未见数据集(UADFV、CelebDF、DeepFakeDataset)上评估泛化能力,以验证对未知生成器的鲁棒性。
实验结果
研究问题
- RQ1生物信号(如PPG)能否作为检测深度伪造视频中生成模型特异性残差的可靠代理?
- RQ2通过生理信号视角解析残差,是否能同时提升虚假/真实检测与源识别的准确率?
- RQ3所提方法能否泛化以检测由先前未见或未知生成模型生成的深度伪造?
- RQ4与基于帧或基于人脸ROI的分类方法相比,引入PPG信号在准确率和计算效率方面表现如何?
主要发现
- 所提方法在FaceForensics++数据集上对视频进行真实/虚假分类的准确率达到97.29%,显著优于基于帧的基线方法。
- 该模型在四类深度伪造生成器与真实视频中识别源生成模型的准确率达到93.39%,展现出强大的源区分能力。
- 与基于帧的方法相比,该方法在单张GPU上每100个周期的训练时间从29小时减少至2小时35分钟,展现出极高的效率。
- 在UADFV和CelebDF等未见数据集上的测试中,模型对真实视频的正确分类率达到93.61%,对深度伪造的正确分类率达到95.83%,证实了对未知生成器的鲁棒性。
- 训练时移除真实类别可提升源检测准确率,减少了环境伪影带来的噪声,验证了真实视频在PPG空间中“杂乱无章”的假设。
- 该方法在不同主干网络(如VGG19、DenseNet201)上泛化良好,且在准确率上超过复杂架构Xception超过10%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。