Skip to main content
QUICK REVIEW

[論文レビュー] MINTIME: Multi-Identity Size-Invariant Video Deepfake Detection

Davide Alessandro Coccomini, Giorgos Kordopatis Zilos|arXiv (Cornell University)|Nov 20, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

MINTIMEは、識別子に配慮したアテンションと新規の埋め込みを用いた変更版TimeSformerを活用し、1回のフォワードパスで複数の人物や異なる顔のサイズを含む動画において空間的・時間的異常を検出する動画ディープフェイク検出モデルを提案する。SOTA性能を達成し、複数人用の動画においてForgeryNetでAUCを最大14%向上させ、クロスフォージャリーおよびクロスデータセット設定でも優れた一般化性能を示す。

ABSTRACT

In this paper, we introduce MINTIME, a video deepfake detection approach that captures spatial and temporal anomalies and handles instances of multiple people in the same video and variations in face sizes. Previous approaches disregard such information either by using simple a-posteriori aggregation schemes, i.e., average or max operation, or using only one identity for the inference, i.e., the largest one. On the contrary, the proposed approach builds on a Spatio-Temporal TimeSformer combined with a Convolutional Neural Network backbone to capture spatio-temporal anomalies from the face sequences of multiple identities depicted in a video. This is achieved through an Identity-aware Attention mechanism that attends to each face sequence independently based on a masking operation and facilitates video-level aggregation. In addition, two novel embeddings are employed: (i) the Temporal Coherent Positional Embedding that encodes each face sequence's temporal information and (ii) the Size Embedding that encodes the size of the faces as a ratio to the video frame size. These extensions allow our system to adapt particularly well in the wild by learning how to aggregate information of multiple identities, which is usually disregarded by other methods in the literature. It achieves state-of-the-art results on the ForgeryNet dataset with an improvement of up to 14% AUC in videos containing multiple people and demonstrates ample generalization capabilities in cross-forgery and cross-dataset settings. The code is publicly available at https://github.com/davide-coccomini/MINTIME-Multi-Identity-size-iNvariant-TIMEsformer-for-Video-Deepfake-Detection.

研究の動機と目的

  • 複数の識別子と変動する顔のサイズを効果的に処理できるディープフェイク検出手法の不足に対処する。
  • フレームごとの分類と、平均値や最大値を単純に集約する手法(例:平均または最大)に起因する、複数人状況での性能低下を克服する。
  • 空間的および時間的文脈を識別子間で保持することで、現実世界の「野生の」状況における検出の頑健性を向上させる。
  • アテンションに基づく局所化により、操作された顔や時刻を細分化して検出可能にする。
  • 多様なデータでエンド・ツー・エンドの学習を実施することで、未観測のフォージャリー技術およびデータセットへの一般化を向上させる。

提案手法

  • 識別子に配慮した自己アテンションを備えた変更版TimeSformerバックボーンを導入し、マスキングを用いて異なる識別子間のアテンションを防止する。各顔のシーケンスを独立して処理する。
  • 各顔のシーケンス内での時間的ダイナミクスを符号化するための時間的整合性のある位置埋め込みを採用し、時間的整合性を保持する。
  • 顔の領域面積と動画フレームサイズの比率を符号化するサイズ埋め込みを組み込み、サイズ不変の表現学習を可能にする。
  • すべての識別子を同時に処理する1回のフォワードパスを実装し、予測の事後集約の必要性を排除し、推論オーバーヘッドを低減する。
  • 集約されたシーケンス表現に学習可能なビデオレベル分類ヘッドを適用し、エンド・ツー・エンドの予測を生成する。
  • ForgeryNetデータセット上でエンド・ツー・エンドにモデルを学習させ、多様なフォージャリー手法およびデータセットへの一般化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1予測の事後集約に依存せずに、複数の識別子が含まれる動画において異常を効果的に検出できるディープフェイク検出モデルは存在するか?
  • RQ2フレームサイズに対する顔のサイズの相対的比率を符号化することで、現実世界のシナリオにおける検出の頑健性がどのように向上するか?
  • RQ31つのフォージャリーデータセットで学習したモデルが、未観測のフォージャリー技術およびデータセットにどの程度一般化できるか?
  • RQ4アテンション機構を用いて、操作された顔や時刻を局所化し、解釈可能な予測を可能にすることができるか?
  • RQ5統一されたアーキテクチャを通じて時間的および空間的異常検出を統合することで、単純な集約手法を用いたフレーム単位分類よりも優れた性能が得られるか?

主な発見

  • MINTIMEは、複数人の人物が登場する動画において、以前のSOTA手法と比較してForgeryNetデータセットでAUCを最大14%向上させた。
  • モデルは強力なクロスフォージャリー一般化性能を示し、DFDCデータセットに含まれる未観測のフォージャリー技術でも高い性能を維持した。
  • DFDCプレビューのテストセットでは、MINTIME-XCが77.92%のAUCを達成し、異なる学習データセットを使用しているにもかかわらずFaceForensics++で学習されたモデルを上回った。
  • 定性的な分析により、アテンションマップが偽物の顔や異常な時間間隔を正確に局所化していることが確認され、解釈可能な検出が可能であることが示された。
  • モデルは、群衆シーンや衣類からの誤検出(例:偽の顔検出)を含む複雑な状況でも、操作された個体を正しく特定する能力を有していた。
  • 識別子に配慮したアテンションとサイズに配慮した埋め込みの導入により、顔のサイズや識別子数が変動する野生の環境下でも性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。