Skip to main content
QUICK REVIEW

[論文レビュー] An Audio-Visual Attention Based Multimodal Network for Fake Talking Face Videos Detection

Ganglai Wang, Peng Zhang|arXiv (Cornell University)|Mar 10, 2022
Face recognition and analysis被引用数 4
ひとこと要約

本稿では、音声と視覚特徴を新規の音声視覚注意メカニズム(AVAM)を用いて統合するマルチモーダル深層学習フレームワーク、FTFDNetを提案する。この手法は人間の多感覚的知覚を模倣し、特に唇および頬領域に注目することで、判別性の高い特徴抽出を実現し、FTFDDデータセット上で97.00%の検出精度を達成した。

ABSTRACT

DeepFake based digital facial forgery is threatening the public media security, especially when lip manipulation has been used in talking face generation, the difficulty of fake video detection is further improved. By only changing lip shape to match the given speech, the facial features of identity is hard to be discriminated in such fake talking face videos. Together with the lack of attention on audio stream as the prior knowledge, the detection failure of fake talking face generation also becomes inevitable. Inspired by the decision-making mechanism of human multisensory perception system, which enables the auditory information to enhance post-sensory visual evidence for informed decisions output, in this study, a fake talking face detection framework FTFDNet is proposed by incorporating audio and visual representation to achieve more accurate fake talking face videos detection. Furthermore, an audio-visual attention mechanism (AVAM) is proposed to discover more informative features, which can be seamlessly integrated into any audio-visual CNN architectures by modularization. With the additional AVAM, the proposed FTFDNet is able to achieve a better detection performance on the established dataset (FTFDD). The evaluation of the proposed work has shown an excellent performance on the detection of fake talking face videos, which is able to arrive at a detection rate above 97%.

研究の動機と目的

  • 唯一の唇の動きが変更された偽の会話顔動画を検出する課題に取り組むこと。この場合、顔認証の特徴は明確に区別しにくくなる。
  • 唇の同期に起因する偽造に特に関連する音声ストリームを無視する既存手法の限界を克服すること。
  • 人間の多感覚的知覚をインスピレーションとして、音声と視覚モダリティを効果的に統合することで検出性能を向上させること。
  • バックボーンアーキテクチャを変更せずに統合可能なモジュラーやプラグイン型の音声視覚注意メカニズム(AVAM)を開発すること。
  • 新たに整備されたベンチマークデータセット(FTFDD)において、最先端の性能を達成すること。

提案手法

  • 動画フレームと音声クリップから視覚的および音声的特徴を共同で符号化する深層ニューラルネットワーク、FTFDNetを提案する。
  • 視覚的特徴間の空間的関係をモデル化するとともに、音声モダリティを組み込んで注目を誘導する、新規の注目メカニズムAVAMを設計する。
  • AVAMは、偽造が最も起こりやすいとされる顔の領域(特に唇と頬)を的確に強調する。
  • 注目メカニズムはモジュラー構成として実装されており、任意のCNNベースの音声視覚アーキテクチャに容易に統合可能である。
  • FTFDDデータセット上でバイナリクロスエントロピー損失を用いてエンドツーエンドでモデルを学習し、時間的文脈はサイズT=3のフレームバッファでモデル化する。
  • AVAMの有効性を検証するためのアブレーションスタディを実施し、従来の注目メカニズム(例:CBAM)と比較するとともに、最適なフレームバッファサイズを評価する。

実験結果

リサーチクエスチョン

  • RQ1音声視覚統合は、唇の動きのみが変更された偽の会話顔動画の検出を改善できるか?
  • RQ2音声を事前知識として組み込むことで、唇同期の偽造動画における微細な顔面改ざんの検出能力が向上するか?
  • RQ3提案されたAVAMメカニズムは、CBAMなどの既存の注目モジュールと比較して、偽の会話顔動画フレームの検出においてどのように優れているか?
  • RQ4フレームバッファを用いた偽動画検出において、最適な時間的文脈長(T)は何か?
  • RQ5音声誘導型注目は、唇や頬などの改ざんされた顔面領域の局在化をどの程度向上させるか?

主な発見

  • 提案されたFTFDNet-AVAMは、FTFDDデータセット上で97.00%の検出精度を達成し、視覚のみのFTFDNet(96.30%)およびFTFDNet-CBAM(96.73%)を上回った。
  • AVAMは、会話顔生成において最も改ざんされやすいとされる唇および頬領域に注目することで、検出性能を顕著に向上させた。
  • アブレーションスタディの結果、T=3が時間的文脈とモデルの複雑さのバランスを最適に保つことが確認され、T=5では精度が低下(95.59%)した。
  • AVAMによる音声視覚統合により、バイナリクロスエントロピー損失は0.0865まで低下し、FTFDNet(0.0933)およびFTFDNet-CBAM(0.099)と比較して、最適化および一般化性能が優れていることが示された。
  • 注目マップの可視化により、AVAMが改ざんされた顔面領域への注目を強化していることが確認され、特徴の判別性向上におけるその役割が裏付けられた。
  • CBAMのチャネル注目部は性能向上にほとんど寄与しなかったため、本タスクにおいて音声によって誘導される空間的注目が、チャネル方向の調整よりもより重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。