Skip to main content
QUICK REVIEW

[論文レビュー] ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images

Binh M. Le, Simon S. Woo|arXiv (Cornell University)|Dec 7, 2021
Digital Media Forensic Detection被引用数 9
ひとこと要約

本稿では、周波数注目 distillation とマルチビュー注目 distillation を活用することで、低品質(LQ)に圧縮されたディープフェイク検出を向上させる知識蒸留フレームワークであるADDを提案する。高品質データで訓練された教師モデルから、高周波成分および相関のある特徴表現を学生モデルに転送することにより、ADDは最先端の性能を達成し、圧縮されたディープフェイクデータセットにおいて最大7.1%の検出精度向上を実現する。

ABSTRACT

Despite significant advancements of deep learning-based forgery detectors for distinguishing manipulated deepfake images, most detection approaches suffer from moderate to significant performance degradation with low-quality compressed deepfake images. Because of the limited information in low-quality images, detecting low-quality deepfake remains an important challenge. In this work, we apply frequency domain learning and optimal transport theory in knowledge distillation (KD) to specifically improve the detection of low-quality compressed deepfake images. We explore transfer learning capability in KD to enable a student network to learn discriminative features from low-quality images effectively. In particular, we propose the Attention-based Deepfake detection Distiller (ADD), which consists of two novel distillations: 1) frequency attention distillation that effectively retrieves the removed high-frequency components in the student network, and 2) multi-view attention distillation that creates multiple attention vectors by slicing the teacher's and student's tensors under different views to transfer the teacher tensor's distribution to the student more efficiently. Our extensive experimental results demonstrate that our approach outperforms state-of-the-art baselines in detecting low-quality compressed deepfake images.

研究の動機と目的

  • 既存のディープフェイク検出器が微細なアーティファクトの損失により性能が低下する低品質圧縮ディープフェイク画像の検出という、重要な課題に対処すること。
  • 圧縮画像が一般的な帯域制限およびストレージ制限のある環境における検出のロバスト性を向上させること。
  • 高品質(HQ)の教師モデルから、低品質(LQ)データで訓練された軽量な学生モデルに、知識蒸留(KD)を活用して特徴を転送すること。
  • 特に、画像圧縮に伴い失われた高周波成分を回復し、圧縮画像内のピクセル単位の相関を維持するための新しい注目メカニズムを設計すること。
  • さまざまなディープフェイク生成手法(例:NeuralTextures, FaceSwap, Face2Face)および異なる圧縮レベルに耐えうる、柔軟で汎用性の高い蒸留フレームワークの開発

提案手法

  • 周波数注目 distillation を導入し、教師モデルの高周波特徴から得られる注目マップを用いて、学生ネットワークが圧縮により失われた高周波成分を回復し、注目を向けるように誘導する。
  • マルチビュー注目 distillation は、スライスされた Wasserstein 距離を用いて、学生の特徴分布を教師のものと複数のテンソルスライスで一致させ、特徴間の相関を保持する。
  • 両方の蒸留コンponentを統合されたKDフレームワーク内に統合し、学生は教師の特徴における周波数的および空間的相関パターンの両方から学習する。
  • さまざまなバックボーンアーキテクチャ(例:ResNet18, ResNet34, EfficientNet-B0)と互換性があり、柔軟な展開が可能である。
  • 蒸留損失は特徴レベルの知識転送と対照的学習を組み合わせ、特徴の識別性と一般化性能を向上させる。
  • 標準的な誤差逆伝播法で最適化される、周波数とマルチビュー注目損失の重み付き組み合わせにより、エンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留は、低品質圧縮ディープフェイク画像で失われた高周波アーティファクトを効果的に回復させ、検出精度を向上させることができるか?
  • RQ2マルチビュー注目 distillation は、圧縮画像検出における教師と学生のネットワーク間で、相関のあるピクセル特徴をどのように向上させるか?
  • RQ3周波数とマルチビュー注目 distillation を組み合わせることで、単一モodalの蒸留と比較して、高圧縮ディープフェイクの検出において相乗効果をもたらすか?
  • RQ4本手法は、さまざまなディープフェイク生成手法(例:NeuralTextures, FaceSwap, Face2Face)および異なる圧縮レベル(例:c23, c40)にわたってどれほどロバストか?
  • RQ5低品質データのみで訓練された学生モデルにおいて、過学習と注目マップの不一致をどれほど軽減できるか?

主な発見

  • EfficientNet-B0バックボーンを用いた場合、ADDはテストされた5つのデータセットすべてでベースラインを上回り、最大7.1%の精度向上を達成した。
  • ResNet50バックボーンを用いた場合、NeuralTexturesデータセットではADDが68.53%の検出精度を達成したのに対し、ベースラインのResNetは60.27%であった。
  • 対照的学習を組み込んだマルチビュー注目 distillation は、非対照的バージョンよりも1.11%の性能向上を示し、特徴分布の一致を強化する利点を裏付けた。
  • c23およびc40という異なる圧縮レベルにおいても一貫した性能向上を示し、画像品質の変動に強いことが確認された。
  • Grad-CAMの可視化結果から、ADDは学生モデルの注目を顔領域に正しく再配分し、背景ノイズを抑制しているのに対し、ベースラインモデルは顔以外の領域に注目を向けることが確認された。
  • ハイパーパrameter α(周波数注目重み)および β(マルチビュー注目重み)に対して、性能が一貫して優れているため、感度が低く、調整に依存しにくいことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。