Skip to main content
QUICK REVIEW

[論文レビュー] ForgeryNet: A Versatile Benchmark for Comprehensive Forgery Analysis

Yinan He, Bei Gan|arXiv (Cornell University)|Mar 9, 2021
Digital Media Forensic Detection参考文献 57被引用数 4
ひとこと要約

ForgeryNet は、290万枚の画像と22万1247本の動画を含む大規模かつマルチタスクのベンチマークデータセットであり、包括的な顔フェイク検出分析を目的としている。4つのタスク—画像・動画のフェイク分類、空間的フェイク局所化、時間的フェイク局所化—を、15種類の画像レベルおよび8種類の動画レベルの改ざん手法、36種類の再レンダリングノイズを用いて実施可能であり、多様で現実世界に近い条件におけるフェイク検出モデルの堅牢な評価を可能にする。

ABSTRACT

The rapid progress of photorealistic synthesis techniques has reached at a critical point where the boundary between real and manipulated images starts to blur. Thus, benchmarking and advancing digital forgery analysis have become a pressing issue. However, existing face forgery datasets either have limited diversity or only support coarse-grained analysis. To counter this emerging threat, we construct the ForgeryNet dataset, an extremely large face forgery dataset with unified annotations in image- and video-level data across four tasks: 1) Image Forgery Classification, including two-way (real / fake), three-way (real / fake with identity-replaced forgery approaches / fake with identity-remained forgery approaches), and n-way (real and 15 respective forgery approaches) classification. 2) Spatial Forgery Localization, which segments the manipulated area of fake images compared to their corresponding source real images. 3) Video Forgery Classification, which re-defines the video-level forgery classification with manipulated frames in random positions. This task is important because attackers in real world are free to manipulate any target frame. and 4) Temporal Forgery Localization, to localize the temporal segments which are manipulated. ForgeryNet is by far the largest publicly available deep face forgery dataset in terms of data-scale (2.9 million images, 221,247 videos), manipulations (7 image-level approaches, 8 video-level approaches), perturbations (36 independent and more mixed perturbations) and annotations (6.3 million classification labels, 2.9 million manipulated area annotations and 221,247 temporal forgery segment labels). We perform extensive benchmarking and studies of existing face forensics methods and obtain several valuable observations.

研究の動機と目的

  • フェイク顔生成技術の深刻化する脅威に対処するため、スケーラブルで多様性に富み、現実的であるような検出研究のためのベンチマークを構築すること。
  • 既存のデータセットが小規模であること、改ざん手法の多様性に欠けること、現実的なノイズの欠如といった限界を克服すること。
  • 画像レベルおよび動画レベルのタスク、特に空間的および時間的局所化を含めた、フェイク検出モデルの包括的評価を可能にすること。
  • 二値分類に加え、15種類のフェイクタイプを含むn値分類(例:n-way)をサポートすることで、現実世界の検出要件を反映すること。
  • 画像、動画、時間的セグメントの複数レベルにわたる豊富なアノテーションを提供し、エンドツーエンドのフェイク分析パイプラインを支援すること。

提案手法

  • クリエイティブ・コモンズライセンスを有する4つの公開データセットから得た自然で多様なオリジナルデータを用いて、ForgeryNetを構築。顔の種類、表情、照明、撮影角度の多様性をカバーする。
  • GAN、RNN、オートエンコーダーを用いたモデルを用い、15種類の深層学習ベースの画像フェイク手法(例:顔交換、再演技、編集)および8種類の動画レベルの手法を適用。
  • 36種類の独立的かつ混合された再レンダリングノイズ(例:圧縮、ぼかし、ノイズ)を適用し、現実世界のメディア伝送および劣化を模擬。
  • 630万件の分類ラベル、290万件の空間的セグメンテーションマスク(改ざん領域)、22万1247件の時間的フェイクセグメントラベルをアノテート。
  • 4つの評価タスクを設計:(1) 二値分類、三値分類、n値分類の画像フェイク分類;(2) 空間的フェイク局所化;(3) ランダムフレーム改ざんを伴う動画レベルのフェイク分類;(4) 時間的フェイク局所化。
  • 標準プロトコルに従い、クロスエントロピー損失、エンドツーエンド学習、マルチクロップ推論戦略を用いて、最先端のモデル(例:SlowFast、X3D-M、BSN、BMN)をデータセット上で学習および評価。

実験結果

リサーチクエスチョン

  • RQ1現実世界のフェイク検出において、データのノイズレベルや再レンダリングの度合いに応じて、モデルの性能はどのように変化するか?
  • RQ2既存のフェイク検出モデルは、未学習の改ざん手法や複雑で混合されたノイズにどの程度一般化できるか?
  • RQ3改ざんが非一様に分布している場合でも、画像の改ざん領域や動画の時間的セグメントを局所化する能力はどの程度効果的か?
  • RQ4動画ベースのフェイク分類において、時間的連続性やフレーム順序の影響は何か?
  • RQ5提案されたベンチマークは、より小規模で多様性に欠けるデータセットでは露呈されない、現在のモデルの限界を明らかにできるか?

主な発見

  • ForgeryNet は、290万枚の画像と22万1247本の動画を有する、公開済みの最大の深層顔フェイクデータセットであり、15種類の画像レベルおよび8種類の動画レベルのフェイク手法をサポートしている。
  • 36種類の異なる再レンダリングノイズを含み、現実世界のメディア劣化を模擬し、検出の難易度を高めている。
  • 動画レベルのフェイク分類モデルは、時間的シャッフルに強く、弱いシャッフル(16フレームごと)条件下でAUCスコア94.11を示し、非時間的特徴に依存していることが示された。
  • 画像レベルのモデルは動画レベルのモデルよりもデータオーギュメンテーションに対して感受性が高く、強化されたオーギュメンテーション条件下で正確性が84.39%(弱)から85.04%(強)に低下した。
  • 境界を意識した時間的局所化モデル(例:BMN)は、本物とフェイクのセグメント遷移点を高精度で特定でき、SoftNMSが重複予測を抑制した。
  • ベンチマークは、最先端のモデルが、細分化されたフェイクタイプ分類や、未学習の改ざん技術・ノイズへの一般化において依然として困難を抱えていることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。