Skip to main content
QUICK REVIEW

[논문 리뷰] Local Class-Specific and Global Image-Level Generative Adversarial Networks for Semantic-Guided Scene Generation

Hao Tang, Dan Xu|arXiv (Cornell University)|2019. 12. 27.
Generative Adversarial Networks and Image Synthesis참고 문헌 64인용 수 14
한 줄 요약

이 논문은 소형 객체 및 세밀한 세부 사항의 생성을 햖을 때 전반적인 이미지 수준의 GAN이 잘 처리하지 못하는 문제를 해결하기 위해 국소적 클래스별 및 전반적인 이미지 수준의 생성 적대 신경망(LGGAN)을 제안한다. 전반적인 이미지 수준의 생성자와 클래스별 국소 생성자, 학습 가능한 가중치 맵 융합 모듈을 결합하여 세부 사항과 소형 객체의 생성을 향상시킨다. 이 방법은 Cityscapes 및 Dayton 데이터셋에서 세분화된 이미지 합성 및 크로스뷰 이미지 번역 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, FID 및 mIoU 지표에서 뚜렷한 향상을 보였다.

ABSTRACT

In this paper, we address the task of semantic-guided scene generation. One open challenge in scene generation is the difficulty of the generation of small objects and detailed local texture, which has been widely observed in global image-level generation methods. To tackle this issue, in this work we consider learning the scene generation in a local context, and correspondingly design a local class-specific generative network with semantic maps as a guidance, which separately constructs and learns sub-generators concentrating on the generation of different classes, and is able to provide more scene details. To learn more discriminative class-specific feature representations for the local generation, a novel classification module is also proposed. To combine the advantage of both the global image-level and the local class-specific generation, a joint generation network is designed with an attention fusion module and a dual-discriminator structure embedded. Extensive experiments on two scene image generation tasks show superior generation performance of the proposed model. The state-of-the-art results are established by large margins on both tasks and on challenging public benchmarks. The source code and trained models are available at https://github.com/Ha0Tang/LGGAN.

연구 동기 및 목표

  • 전반적인 이미지 수준의 GAN이 잘 처리하지 못하는 소형 객체 및 세밀한 질감의 의미 기반 이미지 합성 문제를 해결한다.
  • 공유 파라미터 네트워크에서 더 큰 클래스가 학습을 지배하는 계층적 불균형과 크기의 격차 문제를 해결한다.
  • 다른 의미 클래스에 대해 고유한 표현을 학습하는 국소적 클래스별 생성자를 설계하여 세부 사항 생성을 향상시킨다.
  • 학습 가능한 가중치 맵을 갖춘 엔드 투 엔드 트레이너블 융합 기반 구조를 통해 국소 및 전반적 생성을 통합한다.
  • 구분 능력 있는 클래스별 표현을 향상시키기 위해 새로운 분류 기반 특징 학습 모듈을 개발한다.

제안 방법

  • 공유 인코더, 전반적인 이미지 수준 생성자($G_g$), 각 의미 클래스별로 하나의 클래스별 국소 생성자($G_l$)를 갖는 다중 브랜치 생성자 구조를 제안한다.
  • 의미 맵을 사용해 국소적 특징 맵을 공간적으로 안내하여 각 객체 클래스별로 국소화된 생성을 가능하게 한다.
  • 국소 및 전반적 결과를 요소별 곱셈을 통해 동적으로 융합하는 데 학습 가능한 가중치 맵 생성자($G_w$)를 도입한다.
  • 이미지 공간과 의미 공간 양쪽에서 생성된 이미지를 구분하는 이중 판별자 구조($D_s$)를 사용하여 정밀도와 일관성을 향상시킨다.
  • 더 구분 능력 있는 클래스별 특징 표현을 향상시키기 위해 분류 기반 모듈을 설계하여 국소 생성자 성능을 향상시킨다.
  • 전반적 및 국소 생성을 동시에 최적화하기 위해 적대적 손실, 인지적 손실, 분류 손실을 함께 사용해 전체 네트워크를 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1전반적인 이미지 수준의 생성과 비교해 국소적 클래스별 생성이 소규모 및 세밀한 객체의 합성에 어떻게 기여하는가?
  • RQ2클래스별 특징 학습이 모델이 세밀한 질감과 구조를 생성하는 데 어떤 영향을 미치는가?
  • RQ3학습 가능한 주의 기반 융합을 통한 국소 및 전반적 생성의 융합이 전체 이미지 품질과 의미 일관성에 얼마나 기여하는가?
  • RQ4분류 기반 특징 학습 모듈을 통합하면 개별 객체 클래스에 대해 더 구분 능력 있는 표현을 얻을 수 있는가?
  • RQ5클래스 불균형과 객체 크기 격차는 생성 성능에 어떤 영향을 미치며, 국소화된 학습을 통해 이를 완화할 수 있는가?

주요 결과

  • 제안된 LGGAN은 세분화된 이미지 합성(Cityscapes) 및 크로스뷰 이미지 번역(Dayton) 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 절단 실험 결과, 덧셈 기반 융합 대비 컨볼루션 기반 국소 생성을 사용할 경우 mIoU가 3.5점 향상되고 FID가 6.2점 향상되었다.
  • 분류 기반 특징 학습 모듈을 통한 성능 향상은 베이스라인 국소 생성 대비 mIoU 1.2점, FID 4.3점 향상시켜 효과를 확인했다.
  • 가중치 맵 융합 전략은 mIoU 1.4점, FID 3.6점 향상으로 국소 및 전반적 브랜치의 상호 보완적 이점을 입증했다.
  • 정성적 결과에서는 GauGAN 대비 더 적은 잡음과 더 나은 소형 객체(예: 교통 표지판, 기둥) 및 국소 질감 보존을 확인할 수 있었다.
  • 학습된 특징 맵의 시각화 결과, 각 국소 서브 생성자가 도로, 식생, 차량에 대해 고유한 클래스별 표현을 학습하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.