Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Disentangle GAN Fingerprint for Fake Image Attribution

Tianyun Yang, Juan Cao|arXiv (Cornell University)|Jun 16, 2021
Digital Media Forensic Detection参考文献 37被引用数 10
ひとこと要約

本稿では、生成画像から安定的でコンテンツに依存しないGANフォグプリントを分離し、偽物画像の帰属特定のための判別性の高いGAN固有の特徴を学習する、マルチタスクフレームワークGFD-Netを提案する。感知的および対抗的制約を用いて生成器(G)、識別器(D)、分類器(C)を共同で訓練することで、閉世界およびオープンワールド両方の帰属特定において優れた汎化性能を達成し、フォグプリントはチャネル数ではなくアーキテクチャのレイヤー設計に支配されている。

ABSTRACT

Rapid pace of generative models has brought about new threats to visual forensics such as malicious personation and digital copyright infringement, which promotes works on fake image attribution. Existing works on fake image attribution mainly rely on a direct classification framework. Without additional supervision, the extracted features could include many content-relevant components and generalize poorly. Meanwhile, how to obtain an interpretable GAN fingerprint to explain the decision remains an open question. Adopting a multi-task framework, we propose a GAN Fingerprint Disentangling Network (GFD-Net) to simultaneously disentangle the fingerprint from GAN-generated images and produce a content-irrelevant representation for fake image attribution. A series of constraints are provided to guarantee the stability and discriminability of the fingerprint, which in turn helps content-irrelevant feature extraction. Further, we perform comprehensive analysis on GAN fingerprint, providing some clues about the properties of GAN fingerprint and which factors dominate the fingerprint in GAN architecture. Experiments show that our GFD-Net achieves superior fake image attribution performance in both closed-world and open-world testing. We also apply our method in binary fake image detection and exhibit a significant generalization ability on unseen generators.

研究の動機と目的

  • 偽物画像帰属特定のための解釈可能で安定的かつコンテンツに依存しないGANフォグプリントの欠如に対処すること。
  • コンテンツ関連特徴を学習する直接分類手法の劣った汎化性能を克服すること。
  • 生成画像からGANフォグプリントを分離し、帰属特定に耐性のあるコンテンツに依存しない表現を生成すること。
  • GANフォグプリントの特性を支配するアーキテクチャ的要因を調査すること。

提案手法

  • マルチタスクフレームワークは、生成器(G)、識別器(D)、分類器(C)を共同で訓練し、入力画像からGANフォグプリントを分離する。
  • 生成器はフォグプリントを抽出し、それを本物の画像に重ね合わせてフォグプリント付き画像を生成する。
  • 識別器と分類器は、それぞれ対抗的損失と分類損失を用いて、フォグプリントがコンテンツに依存せず、判別可能であるように監視する。
  • フォグプリント生成中の意味的コンテンツ漏れを抑えるために、感知的損失(L_percept)が適用される。
  • 生成器のボトルネック特徴が、偽物画像帰属特定のためのコンテンツに依存しない表現として用いられる。
  • アブレーションスタディおよび定性的分析を通じて、分離されたフォグプリントの安定性と特徴の明確さが評価される。

実験結果

リサーチクエスチョン

  • RQ1GANフォグプリントはどのようなもので、同じGANから生成された画像間でどれほど安定的で特徴的か?
  • RQ2正規化層やネットワーク構造などのアーキテクチャ的要素は、GANフォグプリントの特性にどのように影響するか?
  • RQ3分離されたGANフォグプリントを用いて、未知の生成器に対しても強力な汎化性能を発揮する堅牢な偽物画像帰属特定が可能か?
  • RQ4チャネル数の変更と比較して、アーキテクチャの変更がフォグプリントに与える影響はどの程度か?
  • RQ5コンテンツ固有のアーチファクトに依存せずに、コンテンツに依存しない表現を効果的に学習する方法は何か?

主な発見

  • GFD-Netは、閉世界およびオープンワールド両方の偽物画像帰属特定において最先端の性能を達成し、複数のデータセットにわたる強い汎化性能を示している。
  • 分離されたGANフォグプリントは、異なるコンテンツ入力に対して安定的で、異なるGAN間で明確に区別可能であり、すべてのアーキテクチャで周期的なテクスチャパターンが確認される。
  • フォグプリントは主にアーキテクチャのレイヤー構成に支配されており、特にインスタンス正規化のデモジュレーションへの置き換えとスキップ・リサルネットワークの使用が顕著な影響を及ぼしている。一方、チャネル数の影響は最小限である。
  • 感知的損失は、フォグプリント内の意味的コンテンツの痕跡を顕著に減少させ、コンテンツに依存しない性質と特徴の質を向上させる。
  • GLCM相関解析により、各GANが固有のフォグプリントシグネチャを持っていることが確認され、特に対角方向(π/4、3π/4)での相関が強い。
  • 本手法は二値偽物画像検出に対しても良好に一般化され、未知の生成器に対してベースライン手法を上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。