Skip to main content
QUICK REVIEW

[論文レビュー] Deepfake Video Detection with Spatiotemporal Dropout Transformer

Daichi Zhang, Fanzhao Lin|arXiv (Cornell University)|Jul 14, 2022
Digital Media Forensic Detection被引用数 4
ひとこと要約

本稿では、顔映像フレームを重複のないパッチの集合に再編集し、ビジョントランスフォーマー(ViT)に供給することで、強力な表現学習を実現する、パッチレベルのディープフェイク動画検出フレームワークである時空間ドロップアウトトランスフォーマー(STD-Former)を提案する。本手法は、偽物の動画に内在する動的で時空間的な不一致を活用する、新しい時空間ドロップアウト操作(ランダムなフレームおよびパッチの削除)を導入することで、モデルの汎用性と耐性を向上させる。複数のベンチマークで最先端の性能を達成し、ViTバックボーン比で平均11.15%の精度向上を達成した。

ABSTRACT

While the abuse of deepfake technology has caused serious concerns recently, how to detect deepfake videos is still a challenge due to the high photo-realistic synthesis of each frame. Existing image-level approaches often focus on single frame and ignore the spatiotemporal cues hidden in deepfake videos, resulting in poor generalization and robustness. The key of a video-level detector is to fully exploit the spatiotemporal inconsistency distributed in local facial regions across different frames in deepfake videos. Inspired by that, this paper proposes a simple yet effective patch-level approach to facilitate deepfake video detection via spatiotemporal dropout transformer. The approach reorganizes each input video into bag of patches that is then fed into a vision transformer to achieve robust representation. Specifically, a spatiotemporal dropout operation is proposed to fully explore patch-level spatiotemporal cues and serve as effective data augmentation to further enhance model's robustness and generalization ability. The operation is flexible and can be easily plugged into existing vision transformers. Extensive experiments demonstrate the effectiveness of our approach against 25 state-of-the-arts with impressive robustness, generalizability, and representation ability.

研究の動機と目的

  • 時間的特徴を無視し、多様なディープフェイク生成手法に一般化できない画像レベルのディープフェイク検出手法の限界を是正すること。
  • フレーム間の局所的顔領域における時空間的不一致——ディープフェイクアーティファクトの主要な兆候——を、動画入力をパッチレベルの表現に再編集することで活用すること。
  • ViTベースのモデルを効果的に拡張し、特徴学習を向上させる柔軟でプラグイン可能な時空間ドロップアウト(STD)機構を設計すること。
  • 多様なディープフェイクデータセットおよび未観測の生成手法に対して、優れた検出性能と強い汎用性・耐性を達成すること。

提案手法

  • 入力動画はまず顔フレームのシーケンスに抽出され、その後各フレームが重複のないグリッド配列の顔パッチに分割され、パッチの集合が形成される。
  • パッチの集合はビジョントランスフォーマー(ViT)に供給され、フレームおよびパッチ間の時空間的特徴を判別的に、かつ強力に学習する。
  • 時空間ドロップアウト(STD)操作を導入:まず時間的ドロップアウトでシーケンスからランダムにフレームを削除し、次に空間的ドロップアウトで残りのフレームからランダムにパッチを破棄する。
  • その結果得られる縮小されたパッチの集合は、完全な顔領域カバレッジを維持しつつ、時間経過に伴う局所的領域の不一致を露呈させ、ディープフェイクアーティファクトへのモデル感受性を向上させる。
  • STDのランダム性により、1動画あたり多様な訓練インスタンスが生成され、効果的なデータ拡張として機能し、汎用性と耐性の向上に寄与する。
  • STD操作はアーキテクチャに依存せず、既存のビジョントランスフォーマー・モデルにスムーズに統合可能である。

実験結果

リサーチクエスチョン

  • RQ1フレームレベルの分析を超えて、フレーム間のパッチレベルの時空間的不一致をモデル化することで、ディープフェイク動画検出性能が向上するか?
  • RQ2時空間ドロップアウト機構は、ディープフェイク検出におけるモデルの耐性と汎用性を向上させるのにどの程度有効か?
  • RQ3提案されたSTD-Formerフレームワークは、多様なディープフェイクデータセットおよび生成手法において、最先端の手法を上回る性能を示すか?
  • RQ4時間的および空間的ドロップアウト率などのハイパーパrameterが、検出性能にどのように影響するか?
  • RQ5STD操作は、さまざまなViTアーキテクチャにどの程度一般化可能か?

主な発見

  • 提案された時空間ドロップアウト(S+T)バージョンが最高の性能を達成し、空間的または時間的ドロップアウトのみのバージョンと比較して、精度およびAUCが向上した。これは、共同での時空間モデリングの必要性を示している。
  • 最適なドロップアウト率は、α = 1/4(時間的ドロップアウト率)およびβ′ = 1/18(空間的ドロップアウト率)であった。性能は、率が高すぎたり低すぎたりすると低下した。
  • Celeb-DF(v2)データセットにおいて、STD-Formerは4つのViTバックボーン(ViT-B16, ViT-B32, ViT-L16, ViT-L32)に対して、STDを備えないベースラインモデル比で平均精度を11.15%、AUCを7.76%向上させた。
  • 25のベンチマークで最先端の性能を達成し、多様なディープフェイク生成手法に対して強い汎用性と耐性を示した。
  • アブレーションスタディにより、STD操作がモデルの耐性と汎用性を顕著に向上させ、異なるViTアーキテクチャおよびネットワーク設計において一貫した改善が得られた。
  • 同じドロップアウトバージョンを用いた強力なベースライン(TD-3DCNN)よりも、本手法は優れた性能を示し、提案されたSTD機構の有効性をさらに裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。