Skip to main content
QUICK REVIEW

[論文レビュー] Statistics of Deep Generated Images

Yu Zeng, Huchuan Lu|arXiv (Cornell University)|Aug 9, 2017
Generative Adversarial Networks and Image Synthesis参考文献 27被引用数 11
ひとこと要約

本稿は、ImageNetおよびコマicsデータセット上で、最先端の深層生成モデル(VAE、DCGAN、WGAN)が生成する画像の低レベル統計的特性を調査する。これらのモデルは非ガウス性およびワイブル分布に従うコントラスト分布を再現するが、スケール不変性を持つ平均パワースペクトルを捉えていないことが判明し、生成画像に人工的な周期的パターンが存在することを示している。

ABSTRACT

Here, we explore the low-level statistics of images generated by state-of-the-art deep generative models. First, Variational auto-encoder (VAE~\cite{kingma2013auto}), Wasserstein generative adversarial network (WGAN~\cite{arjovsky2017wasserstein}) and deep convolutional generative adversarial network (DCGAN~\cite{radford2015unsupervised}) are trained on the ImageNet dataset and a large set of cartoon frames from animations. Then, for images generated by these models as well as natural scenes and cartoons, statistics including mean power spectrum, the number of connected components in a given image area, distribution of random filter responses, and contrast distribution are computed. Our analyses on training images support current findings on scale invariance, non-Gaussianity, and Weibull contrast distribution of natural scenes. We find that although similar results hold over cartoon images, there is still a significant difference between statistics of natural scenes and images generated by VAE, DCGAN and WGAN models. In particular, generated images do not have scale invariant mean power spectrum magnitude, which indicates existence of extra structures in these images. Inspecting how well the statistics of deep generated images match the known statistical properties of natural images, such as scale invariance, non-Gaussianity, and Weibull contrast distribution, can a) reveal the degree to which deep learning models capture the essence of the natural scenes, b) provide a new dimension to evaluate models, and c) allow possible improvement of image generative models (e.g., via defining new loss functions).

研究の動機と目的

  • 深層生成モデル(VAE、DCGAN、WGAN)が自然画像の低レベル統計的特性をどの程度再現するかを評価すること。
  • 深層モデルから生成された画像が、スケール不変性、非ガウス性、ワイブル分布に従うコントラスト分布といった、自然景観に知られている統計的規則性と一致するかを調査すること。
  • 自然画像、コマツアート、深層生成画像の統計的特性を比較し、モデルの一般化性能と限界を評価すること。
  • 自然画像統計に従う統計的整合性に基づいて、生成モデルの新たな評価次元を提案すること。
  • パワースペクトル解析を通じて、生成画像に顕在する構造的アーティファクト、特に周期的パターンを同定すること。

提案手法

  • ImageNetおよび大規模なコマツアートデータセット上でVAE、DCGAN、WGANを訓練し、統計的分析用に画像を生成した。
  • スケール不変性を評価するための平均パワースペクトルの大きさを計算し、4/128、8/128などの周波数成分の分析により周期的パターンを特定した。
  • 輝度およびコントラスト分布を分析したところ、自然画像および生成画像の両方でワイブル分布に従うことが判明した。
  • 尖度および高次統計量を用いて非ガウス性を評価し、すべての画像タイプでガウス分布からの逸脱が確認された。
  • 連結成分統計量およびランダムフィルタ応答を定量的に比較し、画像タイプ間の構造的複雑さを評価した。
  • 12,800枚の生成画像を平均化して周期的アーティファクトを可視化し、空間領域における構造的ノイズの存在を確認した。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデル(VAE、DCGAN、WGAN)は、自然画像に特徴的なスケール不変平均パワースペクトルを再現するか?
  • RQ2生成画像は、自然景観で観察される非ガウス性およびワイブル分布に従うコントラスト分布とどの程度一致するか?
  • RQ3コマツアート画像の統計的特性は、自然画像および深層生成画像とどのように比較できるか?
  • RQ4深層生成画像に、自然画像統計から逸脱する検出可能な構造的アーティファクトが存在するか?
  • RQ5自然画像の統計と類似する統計的類似性が、生成モデルの新たな評価指標として機能できるか?

主な発見

  • 自然画像は $||A(f)|| \propto 1/f^{\alpha}$ のスケール不変平均パワースペクトルを示すが、深層生成画像ではそうではない。生成画像では、4/128周波数の整数倍における局所的最大値が観察された。
  • 生成画像の平均パワースペクトルには、32、16、8、4、2ピクセルの空間的周期を持つ周期的パターンが顕在しており、12,800枚の生成画像を平均化することで可視化された。
  • VAE、DCGAN、WGANで生成された画像は、いずれも顕著な非ガウス性を示し、自然画像と同様の非ガウス的挙動を再現している。
  • 生成画像のコントラスト分布は、自然画像と同様にワイブル分布に従い、部分的な統計的整合性が示された。
  • 非ガウス性およびワイブル分布に従うコントラストにかかわらず、生成画像はスケール不変性を再現できていない。これは根本的な統計的不一致を示している。
  • t統計量およびp値の分析により、生成画像の平均パワースペクトルの大きさが自然画像と顕著に異なることが確認された(ほとんどの比較でp < 0.0001)。特に高周波数帯域で顕著な差が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。