Skip to main content
QUICK REVIEW

[論文レビュー] Deep Face Forgery Detection

Nika Dogonadze, Jana Obernosterer|arXiv (Cornell University)|Apr 6, 2020
Digital Media Forensic Detection参考文献 9被引用数 8
ひとこと要約

この論文では、顔認識からの転移学習と、複数フレーム分析による時系列モデリングを用いた、顔映像偽造の検出のためのディーブラーニング手法を提案している。VGGFace2で事前学習されたInception ResNet V1モデルを微調整し、3D-CNNとBi-LSTMアーキテクチャを用いて隣接フレームを活用することで、FaceForensics++ベンチマークで最先端の精度を達成した。特に、NeuralTexturesによる高圧縮な偽造を検出する点で優れた性能を示した。

ABSTRACT

Rapid progress in deep learning is continuously making it easier and cheaper to generate video forgeries. Hence, it becomes very important to have a reliable way of detecting these forgeries. This paper describes such an approach for various tampering scenarios. The problem is modelled as a per-frame binary classification task. We propose to use transfer learning from face recognition task to improve tampering detection on many different facial manipulation scenarios. Furthermore, in low resolution settings, where single frame detection performs poorly, we try to make use of neighboring frames for middle frame classification. We evaluate both approaches on the public FaceForensics benchmark, achieving state of the art accuracy.

研究の動機と目的

  • FaceSwap、DeepFakes、Face2Face、NeuralTexturesを含む、複数の改ざん手法に対応した顔映像偽造の検出精度を向上させること。
  • NeuralTexturesによって生成された、特に人間やモデルにとっても困難な高圧縮動画における偽造検出の課題に対処すること。
  • 顔認識からの転移学習を活用して、データが少ないまたは新しい改ざん手法に対しても一般化性能と性能を向上させること。
  • 複数の連続フレームをモデル化することで動画シーケンス内の時系列整合性を活用し、単一フレーム分析を上回る分類性能を向上させること。

提案手法

  • 顔認識の事前学習タスクから転移学習を適用し、VGGFace2データセットで事前学習されたInception ResNet V1モデルを微調整することで、偽造検出のための特徴学習を向上させた。
  • 単一フレーム分類には、MTCNNを用いて顔をクロップしたフレームを入力とし、元のdlibベースの顔検出器を置き換えた変更版Inception ResNet V1アーキテクチャを用いた。
  • 時系列モデリングには3D畳み込みニューラルネットワーク(3D-CNN)を用い、共有重みを持つ2D CNNエンコーダから得た特徴マップを連続フレームにわたって積み重ねて3D入力を構成した。
  • 3D-CNNの代替として、2D CNNエンコーダを備えたBi-LSTMモデルも評価したが、パラメータ数がはるかに少ないにもかかわらず同等の性能を達成した。
  • 複数フレーム分類は7フレームのウィンドウ(中央フレームの前後に3フレームずつ)を対象とし、中央フレームの分類にはアンサンブルまたはシーケンスモデリングを用いた。
  • モデルはTesla V100 GPU上でAdam最適化子を用いて学習させ、トレーニング中にデータオーグメンテーションとクラスバランス処理を適用した。

実験結果

リサーチクエスチョン

  • RQ1顔認識の事前学習タスクからの転移学習が、多様な改ざん手法にわたる顔偽造検出性能を顕著に向上させるか?
  • RQ2隣接フレームからの時系列的文脈を組み込むことで、低解像度または高圧縮動画環境下でも検出精度が向上するか?
  • RQ33D-CNNとBi-LSTMアーキテクチャの両方が、偽造検出のための連続フレーム依存関係をモデル化する際に、性能に差を示すか?
  • RQ4NeuralTexturesに特化して学習したモデルが、他の偽造手法や圧縮レベルへ一般化できる範囲はどの程度か?
  • RQ5時系列モデリングは、高圧縮(c40)のNeuralTexturesのような困難なケースにおける微細なアーティファクトを検出するのに役立つか?

主な発見

  • 提案手法は、FaceForensics++ベンチマークで最先端の性能を達成し、全体の精度および困難なNeuralTextures偽造の検出において、従来手法を上回った。
  • VGGFace2で微調整したInception ResNet V1モデルは、NeuralTextures対プリスティン(c40圧縮)シーケンスにおいて77.7%のテスト精度を達成し、ベースラインおよび3D-CNNモデルを上回った。
  • 2D CNNエンコーダを備えたBi-LSTMを用いることで、3D-CNNモデルと同等の77.7%の平均精度を達成したが、パラメータ数が著しく少なかったため、効率性の向上が示された。
  • c40でNeuralTexturesに特化して学習したモデルは、同じ圧縮レベルで75.3%の精度を示したが、他の偽造手法、特にFaceSwapやDeepFakesへの一般化性能は低かった。
  • c40での性能はc23やレイトレース圧縮よりも悪かったが、高圧縮により検出性能が低下する傾向があるものの、この状況下でもベースラインを上回った。
  • 3D-CNNおよびBi-LSTMモデルの両方が、多数決ベースラインを上回ったことから、単一フレーム分類を超える有用なパターンを時系列モデリングが捉えていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。