Skip to main content
QUICK REVIEW

[論文レビュー] MRI-GAN: A Generalized Approach to Detect DeepFakes using Perceptual Image Assessment

Pratikkumar Prajapati, Chris Pollett|arXiv (Cornell University)|Feb 28, 2022
Digital Media Forensic Detection被引用数 9
ひとこと要約

本稿では、構造的類似性(SSIM)を用いて、本物と偽物の顔の間のピクセル単位の差異を強調することで、DeepFakesを検出する、GANベースのフレームワークであるMRI-GANを提案する。74%のテスト精度を達成したが、シンプルなフレームベースのベースライン(91%)に比べて低い性能であったものの、顔交換にとどまらない多様な動画改ざんに適用可能な一般化された、知覚的根拠に基づくアプローチを提供する。

ABSTRACT

DeepFakes are synthetic videos generated by swapping a face of an original image with the face of somebody else. In this paper, we describe our work to develop general, deep learning-based models to classify DeepFake content. We propose a novel framework for using Generative Adversarial Network (GAN)-based models, we call MRI-GAN, that utilizes perceptual differences in images to detect synthesized videos. We test our MRI-GAN approach and a plain-frames-based model using the DeepFake Detection Challenge Dataset. Our plain frames-based-model achieves 91% test accuracy and a model which uses our MRI-GAN framework with Structural Similarity Index Measurement (SSIM) for the perceptual differences achieves 74% test accuracy. The results of MRI-GAN are preliminary and may be improved further by modifying the choice of loss function, tuning hyper-parameters, or by using a more advanced perceptual similarity metric.

研究の動機と目的

  • 多様な生成手法にわたるDeepFakesの検出のための一般化された、ディープラーニングベースの手法を開発すること。
  • 従来の視覚的および統計的分析を回避する合成メディアの検出の課題に対処すること。
  • 特にSSIMを用いた知覚的画像評価を、DeepFakesにおける微細な改ざんを同定する基盤として探求すること。
  • GANベースのMRI生成フレームワークの、本物と偽物の顔面コンテンツを区別する能力を評価すること。
  • 顔交換動画にとどまらず、他の形式の動画改ざんの検出の基盤を構築すること。

提案手法

  • MRI-GANは、入力画像とその関連する本物の画像との間の知覚的差異を、可変の類似性関数(例:SSIM)を用いて計算することで、'画像MRI'を生成するGANを訓練する。
  • 生成器は入力画像とその元の本物画像に基づき、画像差異(MRI)を学習して生成する一方、識別器は本物のMRIと生成されたMRIを区別するGANアーキテクチャを採用する。
  • 知覚的差異関数 f は、改ざんを示すピクセルレベルの不一致を定量化するために、SSIMを用いて実装される。
  • 別個のDeepFake検出モデルは、生成されたMRIを処理し、特徴抽出に事前学習済みのEfficientNet-B0を用い、その後グローバル平均プーリングと、ReLUおよびドロップアウトを含む2層のMLPを適用する。
  • 顔レベルの予測は、閾値ベースの投票メカニズムを用いて動画フレーム全体で集約され、顔のうち一定割合が偽物確率の閾値を超える場合、動画は偽物と分類される。
  • FAKE_FRAME_THRESHOLD や FAKE_FRACTION といったハイパーパrameterは、グリッドサーチにより最適化され、動画レベル分類の精度が向上するように調整される。

実験結果

リサーチクエスチョン

  • RQ1知覚的画像差異(MRI)を生成するGANベースのフレームワークは、標準的なフレームベースモデルに比べて、DeepFakesの検出性能を向上させることができるか?
  • RQ2SSIMは、顔交換動画における微細なアーティファクトを同定する知覚的類似性指標として、どの程度有効か?
  • RQ3MRI-GANフレームワークは、多様なDeepFakes生成手法や実世界の動画条件にどの程度一般化可能か?
  • RQ4MRI-GANは、顔交換の範囲を超えて、非顔交換の動画改ざんの検出に拡張可能か?
  • RQ5顔レベルの予測を集約して正確な動画レベル分類を達成するための最適なハイパーパrameter設定は何か?

主な発見

  • シンプルなフレームベースモデルは91%のテスト精度を達成し、比較のための強力なベースラインを提供した。
  • MRI-GANベースの手法は、SSIMを知覚的差異関数として用いた場合、74%のテスト精度を達成した。これはベースラインに比べて性能が低いことを示している。
  • MRI-GANモデルは、真正陽性率(TPR)69%、偽陰性率(FNR)31%を示し、偽物動画の多くを見逃していることが判明した。
  • MRI-GANの受信器特性曲線下積(AUC)は0.76であり、シンプルなフレームモデルの0.95に比べて顕著に低い。
  • グリッドサーチにより最適パラメータが特定された:MRI-GANでは FAKE_FRAME_THRESHOLD = 0.70、FAKE_FRACTION = 0.30、シンプルなフレームモデルでは 0.80 と 0.30。
  • 著者らは、L2損失の代わりにL1損失を用いること、ZhaiとMin(2021)が提案する高度な知覚的指標を検討することで、ぼやけを軽減し検出性能を向上させることの可能性を指摘している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。