Skip to main content
QUICK REVIEW

[论文解读] Emotions Don't Lie: An Audio-Visual Deepfake Detection Method Using Affective Cues

Trisha Mittal, Uttaran Bhattacharya|arXiv (Cornell University)|Mar 14, 2020
Digital Media Forensic Detection参考文献 53被引用 13
一句话总结

本文提出了一种新颖的音视频深度伪造检测方法,通过利用面部和语音中的模态相似性与感知情绪线索,区分真实与伪造视频。采用带有三元组损失的孪生网络,该方法在 DFDC 上达到 84.4% 的 AUC,在 DF-TIMIT 上达到 96.6% 的 AUC,通过联合建模深度伪造中的音视频一致性与情感错位,优于先前方法。

ABSTRACT

We present a learning-based method for detecting real and fake deepfake multimedia content. To maximize information for learning, we extract and analyze the similarity between the two audio and visual modalities from within the same video. Additionally, we extract and compare affective cues corresponding to perceived emotion from the two modalities within a video to infer whether the input video is "real" or "fake". We propose a deep learning network, inspired by the Siamese network architecture and the triplet loss. To validate our model, we report the AUC metric on two large-scale deepfake detection datasets, DeepFake-TIMIT Dataset and DFDC. We compare our approach with several SOTA deepfake detection methods and report per-video AUC of 84.4% on the DFDC and 96.6% on the DF-TIMIT datasets, respectively. To the best of our knowledge, ours is the first approach that simultaneously exploits audio and video modalities and also perceived emotions from the two modalities for deepfake detection.

研究动机与目标

  • 为应对深度伪造视频日益增长的威胁,通过多模态信号检测伪造的多媒体内容。
  • 利用音视频模态之间的相关性及其感知情绪线索,作为深度伪造检测的判别性信号。
  • 开发一种基于学习的方法,同时分析面部与基于语音的情感线索,以提升检测鲁棒性。
  • 在大规模音视频深度伪造数据集上验证该方法,强调情感一致性对区分真实与伪造内容的作用。

提出的方法

  • 该方法使用孪生神经网络架构,从同一视频中学习面部与语音模态的联合嵌入。
  • 通过使用三元组损失比较同一视频的真实与伪造版本的深度嵌入,计算模态相似性。
  • 从两个模态中提取感知情绪特征(如面部表情与语音语调),并用于计算情感线索相似性。
  • 模型被训练以最小化真实视频嵌入之间的距离,同时最大化伪造视频之间的距离,同时将模态相似性和情绪相似性作为监督信号。
  • 消融实验证实,模态相似性和情绪相似性两个组件均对整体性能有显著贡献。
  • 该框架在包含音视频模态的 DFDC 和 DF-TIMIT 数据集上进行评估。

实验结果

研究问题

  • RQ1跨音视频模态的感知情绪一致性是否能提升深度伪造检测性能?
  • RQ2建模音视频模态之间的相似性是否能增强对合成视频的检测能力?
  • RQ3模态间情感线索的不匹配程度与深度伪造内容之间有何相关性?
  • RQ4模态级相似性与情感级相似性在检测性能中各自贡献多大程度?
  • RQ5该方法能否泛化到训练期间未见过的真实世界、真实场景中的深度伪造视频?

主要发现

  • 所提方法在 DFDC 数据集上实现 84.4% 的视频级 AUC,在 DF-TIMIT 数据集上实现 96.6% 的 AUC,优于最先进方法。
  • 73.2% 的伪造视频在音视频模态间表现出感知情绪标签不一致,而真实视频中仅 24% 出现此类不一致。
  • 消融实验证实,模态相似性和情绪相似性均对检测性能有显著贡献,其中情绪相似性提供了强有力的判别信号。
  • 该模型成功检测到真实社交媒体视频中的深度伪造内容,尽管部分失败案例源于伪造视频中保持了情感一致性。
  • 失败案例出现在伪造视频保留情感一致性,或真实视频表现出自然情感波动时,导致误报。
  • 该方法是首个同时利用音视频模态相似性与感知情绪一致性进行深度伪造检测的工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。