Skip to main content
QUICK REVIEW

[논문 리뷰] Statistics of Deep Generated Images

Yu Zeng, Huchuan Lu|arXiv (Cornell University)|2017. 08. 09.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 11
한 줄 요약

이 논문은 ImageNet 및 캐릭터 이미지 데이터셋에서 최신 딥 생성 모델(VAE, DCGAN, WGAN)이 생성한 이미지의 저수준 통계적 성질을 조사한다. 연구 결과, 이러한 모델들은 비정규성 및 Weibull 대trast 분포를 재현하지만, 척도 불변 평균 파wer 스펙트럼을 포착하지 못함으로써 생성된 이미지에 인위적인 주기적 패턴이 존재함을 드러낸다.

ABSTRACT

Here, we explore the low-level statistics of images generated by state-of-the-art deep generative models. First, Variational auto-encoder (VAE~\cite{kingma2013auto}), Wasserstein generative adversarial network (WGAN~\cite{arjovsky2017wasserstein}) and deep convolutional generative adversarial network (DCGAN~\cite{radford2015unsupervised}) are trained on the ImageNet dataset and a large set of cartoon frames from animations. Then, for images generated by these models as well as natural scenes and cartoons, statistics including mean power spectrum, the number of connected components in a given image area, distribution of random filter responses, and contrast distribution are computed. Our analyses on training images support current findings on scale invariance, non-Gaussianity, and Weibull contrast distribution of natural scenes. We find that although similar results hold over cartoon images, there is still a significant difference between statistics of natural scenes and images generated by VAE, DCGAN and WGAN models. In particular, generated images do not have scale invariant mean power spectrum magnitude, which indicates existence of extra structures in these images. Inspecting how well the statistics of deep generated images match the known statistical properties of natural images, such as scale invariance, non-Gaussianity, and Weibull contrast distribution, can a) reveal the degree to which deep learning models capture the essence of the natural scenes, b) provide a new dimension to evaluate models, and c) allow possible improvement of image generative models (e.g., via defining new loss functions).

연구 동기 및 목표

  • 딥 생성 모델(VAE, DCGAN, WGAN)이 자연 이미지의 저수준 통계적 성질을 얼마나 잘 재현하는지 평가하기 위해.
  • 딥 모델에서 생성된 이미지가 척도 불변성, 비정규성, Weibull 대trast 분포와 같은 자연 풍경의 알려진 통계적 규칙을 충족하는지 조사하기 위해.
  • 자연 이미지, 캐릭터 이미지, 딥 생성 이미지의 통계적 성질을 비교하여 모델의 일반화 능력과 한계를 평가하기 위해.
  • 자연 이미지 통계에 대한 통계적 충실도를 기반으로 새로운 생성 모델 평가 기준을 제안하기 위해.
  • 파워 스펙트럼 분석을 통해 생성된 이미지에 존재하는 구조적 결함, 특히 주기적 패턴을 특정하기 위해.

제안 방법

  • ImageNet과 대규모 캐릭터 이미지 데이터셋에서 VAE, DCGAN, WGAN를 학습하여 통계 분석을 위한 생성 이미지를 확보하였다.
  • 척도 불변성을 평가하기 위해 평균 파워 스펙트럼 크기를 계산하였으며, 4/128, 8/128 등 주파수 성분 분석을 통해 주기적 패턴을 확인하였다.
  • 광도 및 대비 분포를 분석하여 자연 이미지와 생성 이미지 모두에서 Weibull 분포를 따름을 확인하였다.
  • 첨도와 고차 통계를 사용하여 비정규성을 평가하였으며, 모든 이미지 유형에서 정규분포에서의 이탈이 확인되었다.
  • 연결된 성분 통계와 무작위 필터 반응을 측정하여 이미지 유형 간의 구조적 복잡성 수준을 비교하였다.
  • 12,800장의 생성 이미지를 평균화하여 주기적 아티팩트를 시각화하였으며, 이는 공간 도메인에서 구조적 노이즈 존재를 확인하였다.

실험 결과

연구 질문

  • RQ1딥 생성 모델(VAE, DCGAN, WGAN)은 자연 이미지의 특징인 척도 불변 평균 파워 스펙트럼을 재현하는가?
  • RQ2생성된 이미지가 자연 풍경에서 관찰되는 비정규성 및 Weibull 대비 분포와 어느 정도 유사한가?
  • RQ3캐릭터 이미지의 통계적 성질은 자연 이미지와 딥 생성 이미지와 어떻게 비교되는가?
  • RQ4딥 생성 이미지에는 자연 이미지 통계에서 벗어나 존재하는 구조적 아티팩트가 감지 가능한가?
  • RQ5자연 이미지 통계에 대한 통계적 유사성이 생성 모델 평가의 새로운 지표로 활용될 수 있는가?

주요 결과

  • 자연 이미지는 $||A(f)|| \propto 1/f^{\alpha}$ 형태의 척도 불변 평균 파워 스펙트럼을 보이지만, 딥 생성 이미지는 그렇지 않으며, 4/128 주파수의 정수 배수에서 국소 최대값을 보임.
  • 생성 이미지의 평균 파워 스펙트럼은 32, 16, 8, 4, 2 픽셀의 공간 주기를 가진 주기적 패턴을 드러내며, 12,800장의 생성 이미지를 평균화하여 시각화함.
  • VAE, DCGAN, WGAN가 생성한 이미지 모두에서 뚜렷한 비정규성이 관찰되며, 자연 이미지와 동일한 비정규성 행동을 보임.
  • 생성 이미지의 대비 분포는 자연 이미지와 유사하게 Weibull 분포를 따름을 확인하여 부분적인 통계적 충실도를 보임.
  • 비정규성과 Weibull 대비 분포는 충족하나, 척도 불변성은 재현하지 못함으로써 근본적인 통계적 불일치 존재함.
  • t-검정 및 p-값 분석을 통해 생성 이미지의 평균 파워 스펙트럼 크기 값이 자연 이미지와 유의미하게 다름(p < 0.0001, 대부분의 비교에서), 특히 고주파 영역에서 두드러짐.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.