Skip to main content
QUICK REVIEW

[論文レビュー] Multi-spectral Class Center Network for Face Manipulation Detection and Localization

Changtao Miao, Qi Chu|arXiv (Cornell University)|May 18, 2023
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、マルチスペクトルクラスセンターを用いて意味的バイアスを抑える周波数に敏感な特徴量と、マルチレベル特徴量統合を活用することで偽造アーティファクトのモデリングを強化する、顔の改ざん検出および局所化のための新規フレームワーク、マルチスペクトルクラスセンター・ネットワーク(MSCCNet)を提案する。本研究は、新たに構築された高品質なピクセル単位のアノテーション付き FaceForensics++ ベンチマークにおいて、77.22% の mIoU を達成し、最先端の性能を示した。

ABSTRACT

As deepfake content proliferates online, advancing face manipulation forensics has become crucial. To combat this emerging threat, previous methods mainly focus on studying how to distinguish authentic and manipulated face images. Although impressive, image-level classification lacks explainability and is limited to specific application scenarios, spurring recent research on pixel-level prediction for face manipulation forensics. However, existing forgery localization methods suffer from exploring frequency-based forgery traces in the localization network. In this paper, we observe that multi-frequency spectrum information is effective for identifying tampered regions. To this end, a novel Multi-Spectral Class Center Network (MSCCNet) is proposed for face manipulation detection and localization. Specifically, we design a Multi-Spectral Class Center (MSCC) module to learn more generalizable and multi-frequency features. Based on the features of different frequency bands, the MSCC module collects multi-spectral class centers and computes pixel-to-class relations. Applying multi-spectral class-level representations suppresses the semantic information of the visual concepts which is insensitive to manipulated regions of forgery images. Furthermore, we propose a Multi-level Features Aggregation (MFA) module to employ more low-level forgery artifacts and structural textures. Meanwhile, we conduct a comprehensive localization benchmark based on pixel-level FF++ and Dolos datasets. Experimental results quantitatively and qualitatively demonstrate the effectiveness and superiority of the proposed MSCCNet. We expect this work to inspire more studies on pixel-level face manipulation localization. The codes are available (https://github.com/miaoct/MSCCNet).

研究の動機と目的

  • 既存の顔の改ざんデータセットに存在する正確で一貫性のあるピクセル単位のアノテーションの不足が、局所化手法の信頼できる評価と比較を妨げていることに対処する。
  • 技術的知見に基づいたピクセル単位のマスクを用いて FaceForensics++ データセットを再アノテートすることで、顔の改ざん局所化のための包括的なベンチマークを確立する。
  • 意味的バイアスを抑える深層学習フレームワークを構築し、周波数依存の偽造痕跡の検出を強化することで、より正確な局所化を実現する。
  • マルチレベル特徴量統合モジュールを用いて、低レベルの偽造アーティファクトと高レベルの意味的特徴量を統合することで、局所化性能を向上させる。
  • マルチスペクトルクラスセンターを用いた周波数ベースの表現学習の有効性を示し、視覚的意味とは独立した偽造痕跡のモデリングを実現する。

提案手法

  • 2次元 DCT フィルタを用いて特徴量を周波数帯に分解するマルチスペクトルクラスセンター(MSCC)モジュールを提案し、周波数別に表現学習を可能にする。
  • 各周波数帯ごとにクラスセンターを計算し、グラフ畳み込みネットワーク(GCN)を用いてクラスレベル表現の周波数間相互作用と一貫性を向上させる。
  • ピクセルとクラスセンター間の関係から導出される重み付きアテンションマップを用いて、偽造痕跡とは関係のない意味的情報を抑制する深層特徴量の修正を行う。
  • 異なる段階からの特徴量を連結することで低レベルのテクスチャーや偽造アーティファクトを保持するマルチレベル特徴量統合(MFA)モジュールを統合する。
  • クロスエントロピー損失と Dice 損失を組み合わせたセグメンテーションヘッドを用い、MSCCNet アーキテクチャ全体をエンド・トゥ・エンドで最適化する。
  • DCT を用いた周波数分解により、偽造痕跡が顕著に現れる高周波成分を分離し、微細な改ざんに高い感度を示す。

実験結果

リサーチクエスチョン

  • RQ1マルチスペクトル表現学習により、意味的コンテンツへの依存を減らすことで、顔の改ざん局所化モデルの一般化性能とロバスト性が向上するか?
  • RQ2複数の周波数帯にわたり偽造痕跡をモデリングすることで、従来の特徴量学習と比較して、局所化精度がどのように向上するか?
  • RQ3マルチレベル特徴量統合による低レベルの偽造特徴量の統合は、微細な改ざんアーティファクトの検出をどの程度向上させるか?
  • RQ4GCN や DCT フィルタといったアーキテクチャ的要素が、MSCCNet フレームワークにおける性能向上にどのように寄与するか?
  • RQ5新たに構築された高品質なピクセル単位のアノテーション付きベンチマークは、顔の改ざん局所化手法のより信頼性の高い比較的評価を可能にするか?

主な発見

  • 提案された MSCCNet は、新規の高品質なピクセル単位のアノテーション付き FaceForensics++ ベンチマークにおいて、77.22% の平均交差率(mIoU)を達成し、既存手法を上回った。
  • アブレーションスタディの結果、DCT フィルタを除去すると mIoU は 75.92% に低下し、1.3% の性能低下を示した。これは、偽造痕跡を捉えるために周波数分解が重要な役割を果たしていることを裏付けた。
  • GCN レイヤーの導入により、mIoU が 0.6% 向上(76.62% → 77.22%)し、クラスセンター間の周波数間相互作用が向上した。
  • DCT における変換基底を 16 個にすると、mIoU は 76.70% に低下し、周波数成分が多すぎると予測の難易度が上昇し性能が劣化することを示した。
  • MFA モジュールにおける特徴量の連結は加算よりも優れた性能を示し、mIoU は加算の 76.66% から連結の 77.22% に向上した。
  • モデルは画像レベルで 88.07% の精度と AUC 87.61% を達成し、局所化だけでなく二値分類においても優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。