Skip to main content
QUICK REVIEW

[論文レビュー] Level Up the Deepfake Detection: a Method to Effectively Discriminate Images Generated by GAN Architectures and Diffusion Models

Luca Guarnera, Oliver Giudice|arXiv (Cornell University)|Mar 1, 2023
Digital Media Forensic Detection被引用数 4
ひとこと要約

本稿では、14のクラス(9つのGANアーキテクチャ、4つの拡散モデル(DMs)、3つのプリスティン画像データセット)に分類するための、ResNet-34モデルを用いた階層的マルチレベルディープフェイク検出フレームワークを提案する。本手法は、83,000枚の画像から構成される専用データセットと段階的分類戦略を活用することで、全タスク(本物対AI生成、GAN対DM、特定アーキテクチャ同定)で97%を超える精度を達成し、最先端手法を上回っている。

ABSTRACT

The image deepfake detection task has been greatly addressed by the scientific community to discriminate real images from those generated by Artificial Intelligence (AI) models: a binary classification task. In this work, the deepfake detection and recognition task was investigated by collecting a dedicated dataset of pristine images and fake ones generated by 9 different Generative Adversarial Network (GAN) architectures and by 4 additional Diffusion Models (DM). A hierarchical multi-level approach was then introduced to solve three different deepfake detection and recognition tasks: (i) Real Vs AI generated; (ii) GANs Vs DMs; (iii) AI specific architecture recognition. Experimental results demonstrated, in each case, more than 97% classification accuracy, outperforming state-of-the-art methods.

研究の動機と目的

  • GANと拡散モデル(DMs)によって生成された合成画像の検出という、増加する課題に取り組むこと。これらの生成画像はますます現実的で、本物のコンテンツと区別がつきにくくなっている。
  • 従来のディープフェイク検出手法が主に二値分類(本物対偽物)に特化しており、特定の生成モデルを同定する粒度のない課題を克服すること。
  • AI生成コンテンツの検出に加え、その生成に使われた特定のGANまたはDMアーキテクチャを同定できる包括的なフォレンジックソリューションを開発すること。
  • マルチレベル分類により、合成画像のルーツを再構築することで、デジタルメディアにおけるフォレンジックバレリスティックスを支援する、より深いマルチメディアフォレンジックスを実現すること。

提案手法

  • CelebA、FFHQ、ImageNetから40,500枚のプリスティン画像と、9つのGANおよび4つのDMから生成された42,500枚の合成画像を含む、専用の83,000枚の画像データセットを構築した。
  • 3段階の階層的分類パイプラインを設計した:(1) 本物対AI生成、(2) GAN対DM、(3) 特定のGANまたはDMアーキテクチャの同定。
  • ImageNetで事前学習済みの重みを用いたトランスファーラーニングにより、各段階でResNet-34モデルを訓練し、それぞれの分類タスクに合わせて全結合層を微調整した。
  • 段階的な推論戦略を採用し、前方段階の予測結果が次の段階への入力をガイドすることで、全体の精度とモデルの特化度を向上させた。
  • ResNet-18とResNet-34の比較によるモデル選定を行い、全段階で優れた性能を示したため、最終的にResNet-34を採用した。
  • 各段階で50%の訓練、20%の検証、30%のテストに分割する標準的なトレーニングプロトコルを採用し、汎化性能の向上と信頼性の高い評価を確保した。

実験結果

リサーチクエスチョン

  • RQ1階層的ディープラーニングフレームワークは、多様なGANおよび拡散モデルアーキテクチャによって生成された画像と本物画像を効果的に区別できるか?
  • RQ2フラットで単一段階の分類とは対照的に、マルチレベル分類アプローチは、ディープフェイクフォレンジックスにおいて検出精度をどの程度向上させられるか?
  • RQ3本手法は、現代の生成モデルの多様性と現実性の増大にもかかわらず、特定のGANおよびDMアーキテクチャの同定にどの程度うまく対応できるか?
  • RQ4拡散モデルによって生成された画像をトレーニングデータに含めることで、既存の最先端のディープフェイク検出手法の性能にどのような影響を与えるか、特に本物対AI分類において。
  • RQ5階層的アプローチは、複数のソースから構成される複雑な合成メディアに対しても、使用された生成モデルを追跡することで、画像の出自をフォレンジック的に再構築できるか?

主な発見

  • 階層的アプローチは、レベル1(本物対AI生成画像)の分類で97.63%の精度を達成し、AutoGAN(68.5%)やFakespotter(74.22%)といった最先端手法を大きく上回った。
  • レベル2(GAN対DM)では98.01%の精度に達し、両者の異なる生成パラダイムを効果的に分離できることを示した。これは、先行研究がほとんど取り組んでいなかったタスクである。
  • レベル3では、特定のGANアーキテクチャの同定で97.77%、特定の拡散モデルの同定で98.02%の精度を達成し、細分化されたモデル帰属同定の高精度を示した。
  • ResNet-34は全段階でResNet-18を上回り、レベル1では最大2.39ポイント、レベル3のDM認識では最大2.73ポイントの向上を示した。
  • トレーニングデータにDM生成画像を含めることで、既存手法(例:DE-FAKE)の性能は著しく低下した(本物対AI分類で90.52%に低下)。一方、本手法は97%を超える精度を維持し、DMに対して高いロバスト性を示した。
  • 結果から、DMが生成画像に一貫して特徴的な統計的痕跡を残すことが判明し、これを信頼性を持って検出・活用できることが示された。これは、今後のフォレンジック分析における重要な知見である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。