Skip to main content
QUICK REVIEW

[論文レビュー] Zooming into Face Forensics: A Pixel-level Analysis

Jia Li, Tong Shen|arXiv (Cornell University)|Dec 12, 2019
Face recognition and analysis参考文献 47被引用数 8
ひとこと要約

本稿では、顔偽造検出を分類タスクから操作領域の局所化タスクに再定義するピクセル単位のセグメンテーション手法を提案する。FaceForensics++データセット上でセグメンテーションアーキテクチャを評価することで、分類ネットワークに比べてセグメンテーションモデルが偽造顔の検出において顕著に優れていることを示し、複数の操作手法において最先端のmIoUスコアを達成する強力な新しいベースラインを確立した。

ABSTRACT

The stunning progress in face manipulation methods has made it possible to synthesize realistic fake face images, which poses potential threats to our society. It is urgent to have face forensics techniques to distinguish those tampered images. A large scale dataset "FaceForensics++" has provided enormous training data generated from prominent face manipulation methods to facilitate anti-fake research. However, previous works focus more on casting it as a classification problem by only considering a global prediction. Through investigation to the problem, we find that training a classification network often fails to capture high quality features, which might lead to sub-optimal solutions. In this paper, we zoom in on the problem by conducting a pixel-level analysis, i.e. formulating it as a pixel-level segmentation task. By evaluating multiple architectures on both segmentation and classification tasks, We show the superiority of viewing the problem from a segmentation perspective. Different ablation studies are also performed to investigate what makes an effective and efficient anti-fake model. Strong baselines are also established, which, we hope, could shed some light on the field of face forensics.

研究の動機と目的

  • 既存の顔偽造検出手法がグローバル分類タスクとして扱うことに起因する制限を是正すること。
  • 顔偽造検出が分類タスクではなく、ピクセル単位のセグメンテーションタスクとしてより適切に定式化できるかどうかを調査すること。
  • アブレーションスタディを通じて、偽物検出に最も効果的かつ効率的なネットワークアーキテクチャを同定すること。
  • セグメンテーションベースのモデルを用いて、顔偽造検出のための新しい強力なベースラインを確立すること。

提案手法

  • 著者らは、顔偽造検出をセマンティックセグメンテーションタスクとして再定式化し、各ピクセルの真正性スコアを予測するモデルを訓練した。
  • Xception、VGGバージョン、UNet、およびカスタムモデル(FN3)を含む複数のアーキテクチャをFaceForensics++データセットで評価した。
  • 操作済みピクセルと本物ピクセルのクラス不均衡を扱うために、交差エントロピー損失にフォーカル損失を組み合わせた。
  • 活性化マップを用いたカーネル可視化により、学習された特徴を解釈し、モデルの挙動を評価した。
  • スクラッチから訓練したモデルとImageNet事前学習済みモデルの性能を比較するアブレーションスタディを実施した。
  • 局所化精度を評価する主な指標として、平均インターセクションオーバーユニオン(mIoU)を用いた。

実験結果

リサーチクエスチョン

  • RQ1顔偽造検出は分類タスクではなく、セグメンテーションタスクとして定式化すべきであるか?
  • RQ2ピクセル単位の偽物検出に最も適したニューラルネットワークアーキテクチャは何か?
  • RQ3モデルの深さ(浅い vs. 深い)は、顔偽造セグメンテーションの性能に影響を与えるか?
  • RQ4ImageNetでの事前学習は、顔偽造セグメンテーションモデルの一般化性能を向上させるか?

主な発見

  • セグメンテーションベースのモデルは分類ネットワークに比べて顕著に高いmIoUスコアを達成し、最良のモデルではFaceForensics++テストセットで92.45 mIoUに到達した。
  • VGG5(4層)のような浅いモデルがXception(36層)のような深いモデルを上回った。これは、顔偽造検出が低レベルのビジョンタスクである可能性を示唆している。
  • ImageNetでの事前学習は性能向上にほとんど寄与しなかった。これは、一般視覚特徴がこの特定のタスクには有益でないことを示している。
  • カーネル可視化により、人間の認識を超えた微細で直感的でない特徴がモデルが学習していることが明らかになった。これは、自動検出の必要性を強調している。
  • VGG5ベースのセグメンテーションモデルは、Deepfakesで95.78%、Face2Faceで96.21%、FaceSwapで94.81%、NeuralTexturesで75.60%のmIoUを達成し、複数の操作タイプにわたる高いロバスト性を示した。
  • 本研究は、顔偽造検出のための新しいSOTAベースラインを確立した。最良のモデルは、局所化精度において、先行する分類ベースのアプローチを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。