Skip to main content
QUICK REVIEW

[論文レビュー] Fake face detection via adaptive manipulation traces extraction network

Zhiqing Guo, Gaobo Yang|arXiv (Cornell University)|May 11, 2020
Digital Media Forensic Detection参考文献 56被引用数 7
ひとこと要約

本稿では、適応畳み込みを用いて微細な改ざんアーチファクトを動的に特定・強調することで、偽物顔検出を向上させる、新しい適応的改ざん痕跡抽出ネットワークAMTENを提案する。AMTENnetとして知られるCNNベースの検出器に統合された本手法は、既知のFIM技術に対して98.52%の平均精度を達成し、未知の後処理操作に対しては95.17%を示し、最先端手法を著しく上回る性能を発揮する。

ABSTRACT

With the proliferation of face image manipulation (FIM) techniques such as Face2Face and Deepfake, more fake face images are spreading over the internet, which brings serious challenges to public confidence. Face image forgery detection has made considerable progresses in exposing specific FIM, but it is still in scarcity of a robust fake face detector to expose face image forgeries under complex scenarios such as with further compression, blurring, scaling, etc. Due to the relatively fixed structure, convolutional neural network (CNN) tends to learn image content representations. However, CNN should learn subtle manipulation traces for image forensics tasks. Thus, we propose an adaptive manipulation traces extraction network (AMTEN), which serves as pre-processing to suppress image content and highlight manipulation traces. AMTEN exploits an adaptive convolution layer to predict manipulation traces in the image, which are reused in subsequent layers to maximize manipulation artifacts by updating weights during the back-propagation pass. A fake face detector, namely AMTENnet, is constructed by integrating AMTEN with CNN. Experimental results prove that the proposed AMTEN achieves desirable pre-processing. When detecting fake face images generated by various FIM techniques, AMTENnet achieves an average accuracy up to 98.52%, which outperforms the state-of-the-art works. When detecting face images with unknown post-processing operations, the detector also achieves an average accuracy of 95.17%.

研究の動機と目的

  • Deepfake や Face2Face などの高度な技術によって生成された写真のようにリアルな偽物顔画像を検出する課題に対処すること。
  • 画像フォレンジックスにおいて、コンテンツ表現を重視するが微細な改ざん痕跡を軽視する標準CNNの限界を克服すること。
  • JPEG圧縮、ぼかし、リサイズなどの未知の後処理操作に対しても一般化可能な強力な偽物顔検出器を開発すること。
  • SNS上で一般的に配布される前に画像が改ざんされている現実世界の状況でも、検出性能を向上させること。

提案手法

  • バックプロパゲーション中に重みを更新することで、改ざん痕跡を予測する適応的畳み込み層をAMTENに提案し、アーチファクト検出を最適化する。
  • 標準CNNの前処理モジュールとしてAMTENを統合し、コンテンツ表現を抑制し、フォレンジック痕跡を強調する。
  • 一般化性能を向上させるために、さまざまな後処理操作(例:JP-mix, ME-mix)を含む混合データセットでAMTENnetを学習する。
  • JPEG圧縮、ガウスノイズ、メディアンフィルタリングなどの操作を組み合わせたパラメータでデータ拡張を実施し、現実世界の画像劣化を模擬する。
  • 元画像と処理済み画像の比較による残差学習を活用し、改ざんによって生じた不一致を強調する。
  • AMTENnetをエンドツーエンドで訓練し、改ざん痕跡抽出と分類の両方を同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1適応的畳み込みに基づくモジュールは、標準CNNでは見えない微細な改ざん痕跡を効果的に抽出できるか?
  • RQ2AMTENnetは、StyleGAN、Glow、Face2Face などの多様なFIM技術によって生成された偽物顔画像をどれほど効果的に検出できるか?
  • RQ3混合後処理操作で学習させることで、未知の画像改ざんに対する検出器の耐性はどの程度向上するか?
  • RQ4AMTENnetは、現実世界の状況において、GB-mix、MED-mix、SC-mix などの未知の後処理操作に対しても十分に一般化できるか?

主な発見

  • AMTENnetは、Glow, StyleGAN, PGGAN, Face2Face, StarGAN の5つの一般的なFIM技術に対して平均98.52%の検出精度を達成し、MISLnetを著しく上回る。
  • 未知の後処理操作のテストでは、平均95.17%の精度を維持し、強力な一般化能力を示した。
  • 混合データ(例:JP-mix, ME-mix)で学習させることで検出性能が向上し、大規模混合データセットでは平均91.66%の精度にまで向上した。
  • 混合データで学習した検出器は、GB-mix(大規模セットで96.06%の精度)やSC-mix(大規模セットで95.34%の精度)といった他の操作に対しても効果的に一般化した。
  • AMTENは、Constrained-conv や SRM といったベースライン手法に比べ、残差抽出において優れた性能を示し、MISLnet比で平均精度が7.61%向上した。
  • 適応的畳み込み機構により、バックプロパゲーション中に予測された痕跡を層間で再利用することで、改ざん痕跡が効果的に強調された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。