Skip to main content
QUICK REVIEW

[논문 리뷰] RetrieveGAN: Image Synthesis via Differentiable Patch Retrieval

Hung-Yu Tseng, Hsin-Ying Lee|arXiv (Cornell University)|2020. 07. 16.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 4
한 줄 요약

RetrieveGAN은 시나리오 기반 조건부 이미지 합성에 대해 복수의 이미지 패치를 유추하는 미분 가능한 모듈을 제안하며, 이는 엔드 투 엔드 학습과 상호 호환성 있는 패치의 반복적 선택을 가능하게 한다. Gumbel-softmax의 미분 가능성과 공존 손실을 통합함으로써, 의미적으로 일관되고 상호 호환성 있는 패치를 갖는 더 현실적이고 다양한 이미지를 생성하며, 정량적 지표와 사용자 연구에서 비미분 가능한 기준 모델들을 능가한다.

ABSTRACT

Image generation from scene description is a cornerstone technique for the controlled generation, which is beneficial to applications such as content creation and image editing. In this work, we aim to synthesize images from scene description with retrieved patches as reference. We propose a differentiable retrieval module. With the differentiable retrieval module, we can (1) make the entire pipeline end-to-end trainable, enabling the learning of better feature embedding for retrieval; (2) encourage the selection of mutually compatible patches with additional objective functions. We conduct extensive quantitative and qualitative experiments to demonstrate that the proposed method can generate realistic and diverse images, where the retrieved patches are reasonable and mutually compatible.

연구 동기 및 목표

  • 비미분 가능한 유추 방식에서 사전 정의된 임베딩이 생성 과정과 분리되어 발생하는 문제를 해결하기 위해.
  • 유추 과정 중에 공존 관계를 모델링하여 유추된 이미지 패치 간의 상호 호환성을 향상시키기 위해.
  • 유추 과정을 미분 가능하게 하여 유추 및 생성 파이프라인의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 시나리오 그래프 입력 기반으로 패치 임베딩과 생성 과정을 공동 최적화하여 이미지 합성 품질을 향상시키기 위해.
  • 미분 가능하고 반복적인 유추가 의미적으로 일관된 패치를 갖는 더 현실적이고 다양한 이미지 생성으로 이어지는지 검증하기 위해.

제안 방법

  • 이산적 유추 작업을 통해 역전파를 가능하게 하기 위해 Gumbel-softmax 기법을 사용하는 미분 가능한 유추 모듈을 도입한다.
  • 이미 선택된 패치에 조건을 두고 하나씩 패치를 선택하는 반복적 유추 전략을 적용하여 호환성을 보장한다.
  • 실제 이미지에서 관찰되는 공존 패턴을 모델링함으로써, 선택된 패치 간의 상호 호환성을 장려하는 공존 손실 함수를 설계한다.
  • 유추 모듈이 시나리오 그래프에 의미적으로 관련된 패치를 선택하도록 유도하기 위해 진짜 선택 손실을 사용한다.
  • 유추된 패치를 조건부 GAN 기반의 이미지 합성 네트워크와 결합하여 최종 이미지를 생성한다.
  • 전체 파이프라인을 엔드 투 엔드로 학습시켜, 유추 모듈이 이미지 생성 품질을 최적화하도록 하는 임베딩 함수를 학습할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1미분 가능한 유추가 조건부 이미지 합성에 사용되는 이미지 패치의 품질과 호환성에 향상 효과를 줄 수 있는가?
  • RQ2독립적이고 비미분 가능한 유추 방식에 비해, 반복적이고 맥락 인식 유추 방식은 이미지의 현실성과 의미 일관성 측면에서 어떻게 비교되는가?
  • RQ3유추와 생성 과정을 공동 최적화함으로써 이미지의 정밀도와 다양성은 어느 정도 향상되는가?
  • RQ4제안된 공존 손실 함수는 시나리오 내 다수의 객체 간의 상호 호환성을 효과적으로 모델링하고 강제로 적용할 수 있는가?
  • RQ5비미분 가능한 기준 모델에 비해, 미분 가능한 유추 모듈이 더 복잡한 시나리오 기술에 대해 더 우수한 일반화 능력과 성능을 보이는가?

주요 결과

  • RetrieveGAN은 COCO-Stuff 및 Visual Genome 데이터셋에서 최신 기준(FID) 점수를 기록하여 AttnGAN 및 PasteGAN 등의 기준 모델들보다 더 뛰어난 현실성의 이미지를 생성한다.
  • COCO-Stuff에서 더 높은 Inception Score(IS)를 기록하여 생성된 이미지의 다양성이 향상됨을 보여준다.
  • 사용자 연구 결과, RetrieveGAN가 유추한 패치는 PasteGAN에 비해 유의미하게 더 높은 상호 호환성을 보이며, 공존하고 의미적으로 일관된 객체에 대해 통계적으로 유의미한 선호도를 보였다.
  • 절단 실험 결과, 진짜 선택 손실과 공존 손실 모두 이미지 품질 향상과 패치 간 호환성 향상에 기여하는 것으로 확인되었다.
  • 정성적 결과에서는 RetrieveGAN가 더 선명하고 현실적인 객체 외형과 더 나은 공간 일관성을 갖는 이미지를 생성함을 보여주며, 상호 작용하는 다수의 객체를 포함한 복잡한 시나리오에서도 뛰어난 성능을 보였다.
  • 미분 가능한 유추 모듈은 엔드 투 엔드 학습을 가능하게 하여, 유추된 패치와 목표 이미지 간의 정렬을 향상시키기 위해 임베딩 공간을 생성자와 함께 공동 최적화할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.