Skip to main content
QUICK REVIEW

[논문 리뷰] Generative networks as inverse problems with Scattering transforms

Tomás Angles, Stéphane Mallat|arXiv (Cornell University)|2018. 05. 17.
Generative Adversarial Networks and Image Synthesis참고 문헌 13인용 수 7
한 줄 요약

이 논문은 적대적 훈련이나 학습된 인코더가 필요 없도록 사전에 정의된 웨이블릿 산산조각내기 변환 임bedding을 역으로 푸는 방식으로 깊이 있는 컨volutional 생성 네트워크를 역문제로 공식화하는 새로운 생성 모델링 프레임워크를 제안한다. 이 방법은 리프시츠 연속성과 스케일 분리 신호 표현을 통해 GAN과 유사한 이미지 생성 품질과 변형 성질을 달성하며, CelebA, Polygon5, LSUN 데이터셋에서의 정량적 결과는 재구성 및 생성 성능가에서 경쟁력을 보여준다.

ABSTRACT

Generative Adversarial Nets (GANs) and Variational Auto-Encoders (VAEs) provide impressive image generations from Gaussian white noise, but the underlying mathematics are not well understood. We compute deep convolutional network generators by inverting a fixed embedding operator. Therefore, they do not require to be optimized with a discriminator or an encoder. The embedding is Lipschitz continuous to deformations so that generators transform linear interpolations between input white noise vectors into deformations between output images. This embedding is computed with a wavelet Scattering transform. Numerical experiments demonstrate that the resulting Scattering generators have similar properties as GANs or VAEs, without learning a discriminative network or an encoder.

연구 동기 및 목표

  • 거리 기반 훈련에서 차원의 종말 문제로 인해 GAN과 VAE의 일반화에 대한 수학적 이해가 부족한 점을 해결하기 위해.
  • 안정적인 임베딩 연산자를 사전 정의함으로써 생성 모델링에서 적대적 훈련이나 학습된 인코더가 필요 없도록 하기 위해.
  • 판별기나 인코더를 훈련하지 않더라도 생성 네트워크가 GAN과 유사한 이미지 품질과 형태 변형 성질을 달성할 수 있음을 보여주기 위해.
  • 웨이블릿 기반 산산조각내기 변환을 사용한 수학적으로 탄탄한 역문제 프레임워크를 생성 모델링에 제공하기 위해.

제안 방법

  • 생성자는 고정된 사전 정의된 임베딩 연산자, 즉 웨이블릿 산산조각내기 변환의 역함수로 훈련되며, 이는 변형에 대해 리프시츠 연속성을 갖는다.
  • 임베딩 연산자는 웨이블릿 산산조각내기 변환을 사용하여 이동을 선형화하고, 국소적 l¹ 노름을 통해 파동수 계수의 가우시안화를 제공한다.
  • 생성자는 DCGAN과 동일한 아키텍처를 가진 깊이 있는 컨volutional 네트워크로 구현되며, 과적합 방지를 위해 역함수를 정규화한다.
  • 재구성된 이미지와 원본 훈련 이미지 간의 L¹ 손실을 최소화함으로써 역함수를 수행하며, 산산조각내기 계수를 잠재 코드로 사용한다.
  • 이 방법은 웨이블릿 계수의 희박성과 네트워크 활성화의 희박성(70%가 0)을 암묵적 정규화로 활용한다.
  • 초기화 수치 조정을 피하고 산산조각내기 변환의 내재적 성질에 의존하여 안정적이고 일반화 가능한 이미지 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고정된 임베딩 연산자의 역함수를 통해 적대적 훈련이나 학습된 인코더 없이도 생성 이미지 합성을 달성할 수 있는가?
  • RQ2GAN에서 관찰된 변형 및 형태 변형 행동을 재현하기 위해 임베딩 연산자의 어떤 성질이 필수적인가?
  • RQ3학습된 인코더와 비교할 때 산산조각내기 변환을 임베딩 연산자로 사용했을 때 재구성 및 일반화 성능는 어떻게 되는가?
  • RQ4웨이블릿 계수와 네트워크 활성화의 희박성이 생성자에 대한 일반화 능력에 얼마나 기여하는가?
  • RQ5생성 모델링의 역문제 공식화가 암묵적 생성 모델보다 더 해석 가능하고 수학적으로 탄탄한 대안을 제공할 수 있는가?

주요 결과

  • 산산조각내기 생성자는 CelebA 테스트 세트에서 PSNR 재구성 오차 21.17 dB, Polygon5에서 34.44 dB, LSUN(침실)에서 18.53 dB를 기록하여 강력한 재구성 정밀도를 보였다.
  • 산산조각내기 잠재 공간 내 선형 보간은 훈련 및 테스트 이미지 사이에서 매끄럽고 연속적인 이미지 변형을 생성하며, GAN과 유사한 형태 변형 행동을 재현했다.
  • 생성자는 Polygon5와 CelebA와 같은 더 단순한 데이터셋에서는 고해상도이고 선명한 이미지를 생성하지만, LSUN 이미지는 메모리 용량 제한으로 인해 고주파 성분을 손실하는 경향을 보였다.
  • 네트워크는 평균적으로 활성화의 70%가 희박함을 보이며, 이는 희박성이 학습된 생성자에서 핵심 정규화 메커니즘이라는 것을 시사한다.
  • 훈련 데이터를 256개 샘플로 줄였을 때 고주파 성분의 재구성이 복구됨을 확인하여, 이미지 품질 저하가 아키텍처 결함이 아니라 메모리 제약 때문임을 입증했다.
  • 무작위 가우시안 노이즈 입력에 대해서도 잘 일반화되어 있으며, 특히 더 단순한 데이터셋에서는 훈련 데이터와 강한 视覚 유사성을 가진 이미지를 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.