Skip to main content
QUICK REVIEW

[论文解读] An Audio-Visual Attention Based Multimodal Network for Fake Talking Face Videos Detection

Ganglai Wang, Peng Zhang|arXiv (Cornell University)|Mar 10, 2022
Face recognition and analysis被引用 4
一句话总结

本文提出 FTFDNet,一种多模态深度学习框架,通过一种新颖的音视频注意力机制(AVAM)融合音频与视觉特征,以检测伪造的说话人脸视频。受人类多感官感知启发,AVAM 通过聚焦于嘴唇和面颊区域,增强了判别性特征学习,在 FTFDD 数据集上实现了 97.00% 的检测准确率。

ABSTRACT

DeepFake based digital facial forgery is threatening the public media security, especially when lip manipulation has been used in talking face generation, the difficulty of fake video detection is further improved. By only changing lip shape to match the given speech, the facial features of identity is hard to be discriminated in such fake talking face videos. Together with the lack of attention on audio stream as the prior knowledge, the detection failure of fake talking face generation also becomes inevitable. Inspired by the decision-making mechanism of human multisensory perception system, which enables the auditory information to enhance post-sensory visual evidence for informed decisions output, in this study, a fake talking face detection framework FTFDNet is proposed by incorporating audio and visual representation to achieve more accurate fake talking face videos detection. Furthermore, an audio-visual attention mechanism (AVAM) is proposed to discover more informative features, which can be seamlessly integrated into any audio-visual CNN architectures by modularization. With the additional AVAM, the proposed FTFDNet is able to achieve a better detection performance on the established dataset (FTFDD). The evaluation of the proposed work has shown an excellent performance on the detection of fake talking face videos, which is able to arrive at a detection rate above 97%.

研究动机与目标

  • 解决仅通过调整嘴唇动作以匹配语音而生成的伪造说话人脸视频检测难题,此类视频中身份特征难以区分。
  • 克服现有方法忽略音频流的局限性,尽管音频与唇音同步伪造密切相关。
  • 借鉴人类多感官感知机制,通过有效融合音频与视觉模态,提升检测性能。
  • 开发一种模块化、可插拔的音视频注意力机制(AVAM),在不修改主干网络架构的前提下增强特征表示能力。
  • 在新建立的基准数据集(FTFDD)上实现伪造说话人脸视频检测的最先进性能。

提出的方法

  • 提出 FTFDNet,一种深度神经网络,联合编码来自视频帧和音频片段的视觉与音频特征。
  • 设计 AVAM,一种新颖的注意力机制,用于建模视觉特征之间的空间关系,同时引入音频模态以引导注意力。
  • AVAM 选择性地突出显示关键面部区域——尤其是嘴唇和面颊——这些区域最可能成为伪造操作的目标。
  • 该注意力机制以模块化组件形式实现,可无缝集成到任何基于 CNN 的音视频架构中。
  • 使用二元交叉熵损失在 FTFDD 数据集上端到端训练模型,通过大小为 T=3 的帧缓冲区建模时间上下文。
  • 开展消融实验,验证 AVAM 相较于传统注意力机制(如 CBAM)的有效性以及最优帧缓冲区大小。

实验结果

研究问题

  • RQ1音视频融合是否能提升对仅嘴唇动作被篡改的伪造说话人脸视频的检测能力?
  • RQ2将音频作为先验知识引入,是否能增强模型检测唇音同步视频中细微面部篡改的能力?
  • RQ3所提出的 AVAM 机制与现有注意力模块(如 CBAM)相比,在检测伪造说话人脸帧方面表现如何?
  • RQ4使用帧缓冲区进行有效伪造视频检测的最优时间上下文长度(T)是多少?
  • RQ5音频引导的注意力在多大程度上改善了对篡改面部区域(如嘴唇和面颊)的定位能力?

主要发现

  • 所提出的 FTFDNet-AVAM 在 FTFDD 数据集上实现了 97.00% 的检测准确率,优于仅使用视觉的 FTFDNet(96.30%)和 FTFDNet-CBAM(96.73%)。
  • AVAM 通过聚焦于最易受伪造影响的嘴唇和面颊区域,显著提升了检测性能。
  • 消融实验表明,T=3 在时间上下文与模型复杂度之间提供了最佳平衡,因为 T=5 的准确率(95.59%)低于 T=3(96.30%)。
  • 通过 AVAM 实现的音视频融合将二元交叉熵损失降低至 0.0865,相比 FTFDNet(0.0933)和 FTFDNet-CBAM(0.099)显示出更优的优化与泛化能力。
  • 注意力图可视化结果证实,AVAM 有效增强了对篡改面部区域的关注,验证了其在提升特征判别能力方面的作用。
  • CBAM 的通道注意力组件对性能贡献甚微,表明在此任务中,由音频引导的空间注意力比通道调制更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。