Skip to main content
QUICK REVIEW

[論文レビュー] AV-Lip-Sync+: Leveraging AV-HuBERT to Exploit Multimodal Inconsistency for Deepfake Detection of Frontal Face Videos

Sahibzada Adil Shahzad, Ammarah Hashmi|arXiv (Cornell University)|Nov 5, 2023
Digital Media Forensic Detection被引用数 4
ひとこと要約

本論文は、AV-HuBERTとViViTを用いて自己教師付き音声視覚表現を活用し、発話と口の動きの不一致を検出する最先端の音声視覚ディープフェイク検出モデルAV-Lip-Sync+を提案する。マルチモーダルな同期特徴と空間時間的顔面アーチファクトを組み合わせることで、FakeAVCelebおよびDeepfakeTIMITデータセットにおいて新たな最先端性能を達成し、DeepfakeTIMITでは高品質(HQ)でAUC 0.9998、低品質(LQ)でAUC 0.9996を達成した。

ABSTRACT

Multimodal manipulations (also known as audio-visual deepfakes) make it difficult for unimodal deepfake detectors to detect forgeries in multimedia content. To avoid the spread of false propaganda and fake news, timely detection is crucial. The damage to either modality (i.e., visual or audio) can only be discovered through multimodal models that can exploit both pieces of information simultaneously. However, previous methods mainly adopt unimodal video forensics and use supervised pre-training for forgery detection. This study proposes a new method based on a multimodal self-supervised-learning (SSL) feature extractor to exploit inconsistency between audio and visual modalities for multimodal video forgery detection. We use the transformer-based SSL pre-trained Audio-Visual HuBERT (AV-HuBERT) model as a visual and acoustic feature extractor and a multi-scale temporal convolutional neural network to capture the temporal correlation between the audio and visual modalities. Since AV-HuBERT only extracts visual features from the lip region, we also adopt another transformer-based video model to exploit facial features and capture spatial and temporal artifacts caused during the deepfake generation process. Experimental results show that our model outperforms all existing models and achieves new state-of-the-art performance on the FakeAVCeleb and DeepfakeTIMIT datasets.

研究の動機と目的

  • 音声および視覚モダリティの両方が改ざんされているマルチモーダルディープフェイクを検出する挑戦に応えること。単一モダリティ検出器では検出できない。
  • 特にリップシンクエラーを特徴とする、前面顔映像におけるディープフェイク検出のための音声視覚的不一致を活用すること。
  • 自己教師付き音声視覚表現と空間時間的顔面特徴学習を組み合わせることで、多様なディープフェイク生成手法に対する耐性を向上させること。
  • 音声視覚的不一致と顔面アーチファクトを共同でモデリングすることで、FakeAVCelebやDeepfakeTIMITなどのベンチマークデータセットで既存の最先端モデルを上回ること。

提案手法

  • モデルは、発話と口の動きの同期を捉えるために、事前学習済みの自己教師付き音声視覚特徴抽出器AV-HuBERTを用いる。
  • 時間的相関を音声・視覚モダリティ間でモデル化するために、マルチスケール時間的畳み込みネットワーク(TCN)を適用する。
  • リップ領域を超えた空間的・時間的顔面特徴を抽出するために、別個のビジョントランスフォーマー(ViViT)を採用する。これにより、リップ以外のアーチファクトの検出が向上する。
  • AV-HuBERT(リップレベル)とViViT(全身顔)からの特徴を統合し、音声視覚的一致性と顔面の空間時間的異常を共同でモデリングする。
  • モデルはエンドツーエンドまたは固定フロントエンドで微調整され、各コンポonentの寄与を検証するためのアブレーションスタディが実施された。
  • 最終分類の前に、マルチモーダル特徴を投影・統合するために線形層が用いられた。

実験結果

リサーチクエスチョン

  • RQ1AV-HuBERTから得られる自己教師付き音声視覚表現は、ディープフェイク動画におけるリップシンク不一致を効果的に検出できるか?
  • RQ2ViViTを用いて全身顔面特徴を組み込むことで、リップ領域が最小限に改ざんされた場合の検出性能が向上するか?
  • RQ3提案手法による音声視覚的同期と空間時間的顔面アーチファクトの統合は、既存の単一モダリティおよびマルチモーダルディープフェイク検出器と比較してどのように優れているか?
  • RQ4AV-Lip-Sync+は、ベンチマークデータセット上で多様なディープフェイク生成手法にどの程度一般化可能か?

主な発見

  • AV-Lip-Sync+は、DeepfakeTIMITの高品質(HQ)バージョンでSOTAのAUC 0.9998を達成し、すべての先行モデルを上回った。
  • DeepfakeTIMITの低品質(LQ)バージョンではAUC 0.9996を達成し、視覚的劣化に対しても耐性があることが示された。
  • 特徴抽出器を共同で訓練したモデル(AV-Lip-Sync+ with FE)は、LQでAUC 0.9996、HQでAUC 0.9998を達成し、優れた一般化性能を示した。
  • アブレーションスタディの結果、微調整された線形層を備えた固定フロントエンドが優れた性能を示し、効果的な特徴適応が可能であることが確認された。
  • FakeAVCelebデータセットでも、AV-Lip-Sync+は新たなSOTA性能を達成し、すべての評価設定でAUC 0.96を超えた。
  • 全身顔面特徴抽出にViViTを統合することで、リップ領域分析をはるかに超える検出性能が向上し、特に微細なまたはリップ以外の改ざんに対して顕著な改善が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。