Skip to main content
QUICK REVIEW

[논문 리뷰] TGAN: Deep Tensor Generative Adversarial Nets for Large Image Generation

Zihan Ding, Xiao-Yang Liu|arXiv (Cornell University)|2019. 01. 28.
Generative Adversarial Networks and Image Synthesis참고 문헌 28인용 수 13
한 줄 요약

이 논문은 텐서 공간에서 작동하는 딥 텐서 생성 적대적 네트워크인 TGAN을 제안한다. 이는 픽셀 공간 대신 텐서 공간에서 작동함으로써 대규모 고품질 이미지를 생성한다. 딥 컨volution 신경망과 텐서 슈퍼레졸루션을 통합함으로써 TGAN은 공간적 구조와 국소적 픽셀 근접성을 유지하며, PASCAL2에서 $374\times374$ 이미지를 생성함으로써 인ception 스코어와 현실감 있는 이미지 생성에서 최신 기술 수준을 달성한다. 이는 이전 방법 대비 8.5배 크기의 증가이다.

ABSTRACT

Deep generative models have been successfully applied to many applications. However, existing works experience limitations when generating large images (the literature usually generates small images, e.g. 32 * 32 or 128 * 128). In this paper, we propose a novel scheme, called deep tensor adversarial generative nets (TGAN), that generates large high-quality images by exploring tensor structures. Essentially, the adversarial process of TGAN takes place in a tensor space. First, we impose tensor structures for concise image representation, which is superior in capturing the pixel proximity information and the spatial patterns of elementary objects in images, over the vectorization preprocess in existing works. Secondly, we propose TGAN that integrates deep convolutional generative adversarial networks and tensor super-resolution in a cascading manner, to generate high-quality images from random distributions. More specifically, we design a tensor super-resolution process that consists of tensor dictionary learning and tensor coefficients learning. Finally, on three datasets, the proposed TGAN generates images with more realistic textures, compared with state-of-the-art adversarial autoencoders. The size of the generated images is increased by over 8.5 times, namely 374 * 374 in PASCAL2.

연구 동기 및 목표

  • 딥 생성 모델을 사용하여 대규모 고해상도 이미지를 생성하는 데 도전하는 것.
  • 계산 복잡성과 모드 붕괴로 인해 고차원 데이터 처리에 어려움을 겪는 전통적 GAN의 한계를 극복하는 것.
  • 공간 패턴과 국소적 근접성을 유지하는 텐서 기반 표현을 활용하여 이미지 품질과 구조적 정확성을 향상시키는 것.
  • 확장 가능한 고해상도 이미지 생성을 위한 DCGAN과 텐서 슈퍼레졸루션을 조합한 계단식 프레임워크를 개발하는 것.
  • PASCAL2와 같은 대규모 데이터셋에서 뛰어난 성능을 입증하며, $374\times374$ 이미지 생성을 달성하는 것.

제안 방법

  • 방법은 텐서 공간에서 작동하며, 벡터화된 이미지 표현 대신 텐서화된 데이터를 사용하여 공간적 및 구조적 관계를 더 잘 포착한다.
  • 계단식 아키텍처는 딥 컨volution 신경망과 텐서 슈퍼레졸루션 모듈을 통합하여 점진적인 이미지 정밀도 향상을 달성한다.
  • 텐서 슈퍼레졸루션 과정은 텐서 사전 학습과 텐서 계수 학습을 포함하며, 압축되고 효율적인 표현을 위해 t-선형 조합을 사용한다.
  • 순환 행렬을 사용하여 이동 불변성을 유지함으로써 업샘플링 중 공간적 구조를 보존한다.
  • 생성자는 임의의 노이즈를 저해상도 텐서로 매핑하는 것을 학습하며, 이후 텐서 기반 슈퍼레졸루션을 통해 고해상도 출력을 생성한다.
  • 판별자는 텐서 공간에서 생성된 이미지의 현실성을 평가함으로써, 질감과 구조적 세부 정보를 유지하는 적대적 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1텐서 공간에서 작동하는 생성 적대적 네트워크가 표준 픽셀 공간 GAN보다 대규모 고품질 이미지를 더 잘 생성할 수 있는가?
  • RQ2벡터화된 표현에 비해 텐서 기반 표현은 공간 패턴과 국소적 픽셀 근접성을 어떻게 향상시키는가?
  • RQ3텐서 슈퍼레졸루션은 대규모 이미지 생성에서 이미지 품질과 세부 사항의 정확성에 얼마나 기여하는가?
  • RQ4제안된 계단식 TGAN 프레임워크는 AAE와 같은 최신 기술 모델보다 더 높은 인ception 스코어와 시각적 품질을 달성하는가?
  • RQ5이 방법은 $374\times374$ 해상도의 이미지를 생성하면서도 현실감과 구조적 일관성을 유지할 수 있는가?

주요 결과

  • TGAN은 PASCAL2 데이터셋에서 $374\times374$ 이미지에 대해 인ception 스코어 4.02를 기록하여 AAE의 3.81보다 뚜렷이 높게 성과를 냈다.
  • MNIST 데이터셋에서 TGAN은 16개의 이미지 중 오직 2개만 흐릿하게 생성했고, AAE는 6개를 흐릿하게 생성하여 더 높은 시각적 품질과 특징 명확성을 보였다.
  • 제거 실험 결과, 텐서 슈퍼레졸루션의 기여도가 뚜렷하게 드러났으며, 이와 같은 모듈이 없는 경우 세부 사항이 빠지고 더 흐릿한 이미지가 생성되었다.
  • TGAN은 PASCAL2에서 $374\times374$ 이미지를 생성하여 이전 방법(예: AAE) 대비 이미지 크기를 8.5배 증가시켰다.
  • 벡터 기반 방법보다 공간적 구조와 국소적 근접성을 더 잘 유지하여 더 현실적인 질감과 선명한 특징을 구현했다.
  • 텐서 기반 사전 학습을 사용함으로써 사전 크기를 줄이고 계산 복잡성을 감소시켜 훈련 속도를 향상시키면서도 높은 표현 효율성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.