Skip to main content
QUICK REVIEW

[논문 리뷰] Compositional Transformers for Scene Generation

Drew A. Hudson, C. Lawrence Zitnick|arXiv (Cornell University)|2021. 11. 17.
Generative Adversarial Networks and Image Synthesis참고 문헌 74인용 수 11
한 줄 요약

GANformer2는 복합적 인场景 생성을 위한 이중 단계, 객체 중심의 트랜스포머를 제안하며, 먼저 반복적인 객체 수준의 보완을 통해 고수준 레이아웃을 계획하고, 그 다음 이중 주의를 통해 사진처럼 사실적인 이미지를 생성한다. CLEVR와 COCO에서 이미지 품질, 다양성, 의미 일致성 측면에서 최신 기술 수준의 성능을 달성하였으며, 명시적인 구조적 사전 지식을 통해 더 나은 분리성과 해석 가능성도 확보하였다.

ABSTRACT

We introduce the GANformer2 model, an iterative object-oriented transformer, explored for the task of generative modeling. The network incorporates strong and explicit structural priors, to reflect the compositional nature of visual scenes, and synthesizes images through a sequential process. It operates in two stages: a fast and lightweight planning phase, where we draft a high-level scene layout, followed by an attention-based execution phase, where the layout is being refined, evolving into a rich and detailed picture. Our model moves away from conventional black-box GAN architectures that feature a flat and monolithic latent space towards a transparent design that encourages efficiency, controllability and interpretability. We demonstrate GANformer2's strengths and qualities through a careful evaluation over a range of datasets, from multi-object CLEVR scenes to the challenging COCO images, showing it successfully achieves state-of-the-art performance in terms of visual quality, diversity and consistency. Further experiments demonstrate the model's disentanglement and provide a deeper insight into its generative process, as it proceeds step-by-step from a rough initial sketch, to a detailed layout that accounts for objects' depths and dependencies, and up to the final high-resolution depiction of vibrant and intricate real-world scenes. See https://github.com/dorarad/gansformer for model implementation.

연구 동기 및 목표

  • 기존 GAN이 복잡한 다강인물 장면을 모델링하는 데에 낮은 제어성과 해석 가능성으로 인해 약점이 있음을 해결하기 위해.
  • 객체와 그들의 공간적, 의미적, 관계적 의존성을 명시적으로 모델링하여 체계적이고 계층적인 이미지 생성을 가능하게 하기 위해.
  • 구조(레이아웃)와 스타일(외관)을 투명하고 반복적인 과정에서 분리함으로써 분리성과 제어성을 향상시키기 위해.
  • 합성 및 실세계 데이터셋 모두에서 정밀도, 다양성, 일관성 측면에서 최신 기술 수준의 성능을 입증하기 위해.
  • 지식 기반의 지도 없는 세그멘테이션 예측 결과를 사용하여 학습함으로써 모델의 강건성을 검증하기 위해.

제안 방법

  • 모델은 각 객체 또는 엔터티를 나타내는 학습 가능한 잠재 변수 세트를 사용하며, 각각에 대해 구조와 스타일이 할당된다.
  • 계획 단계에서는 객체 잠재변수를 참조하고 그들의 공간적 위치, 형태, 상대적 순서를 개선함으로써 반복적으로 고수준 장면 레이아웃을 구성한다.
  • 실행 단계에서는 이중 주의를 사용하여 레이아웃을 사진처럼 사실적인 이미지로 개선하며, 각 잠재변수가 해당 세그먼트의 콘텐츠와 스타일을 이끈다.
  • 생성자는 비포화 GAN 손실과 게으른 R1 정규화를 사용하여 학습되며, 동일한 학습률과 지수 이동 평균을 사용하는 Adam 옵티마이저를 적용한다.
  • 판별자는 구성적 충실도를 장려하기 위해 구조적 손실을 강화하였으며, 모델은 StyleGAN2의 기법들(예: 스타일 혼합, 미니배치 표준편차)을 활용한다.
  • 모델은 기울기 누적을 사용하여 $256 \times 256$ 이미지로 학습하며, 잠재 차원과 R1 요소를 안정성과 성능 향상을 위해 조정한다.

실험 결과

연구 질문

  • RQ1명시적인 객체 수준 잠재변수를 가진 이중 단계 트랜스포머 기반 생성자로 기존 GAN보다 복잡한 다강인물 장면을 더 잘 생성할 수 있는가?
  • RQ2반복적인 계획 및 실행 과정이 구조와 스타일의 분리성 향상에 얼마나 기여하는가?
  • RQ3자동 예측된 세그멘테이션으로 학습된 모델이 COCO와 같은 도전적이고 다양한 데이터셋에 얼마나 잘 일반화되는가?
  • RQ4모델이 가려진 객체의 다형적 완성(амодальное completion)을 보여주며 장면 구성에 대한 추론을 암묵적으로 수행하는가?
  • RQ5정밀도, 다양성, 일관성 측면에서 무조건적 및 조건부 이미지 합성 모두에서 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • GANformer2는 CLEVR와 COCO 데이터셋 모두에서 최신 기술 수준의 FID 스코어를 달성하여, StyleGAN2 및 GANformer와 같은 기준 모델들보다 뛰어난 이미지 품질과 다양성을 보였다.
  • 모델은 높은 수준의 의미 일관성을 보였으며, 특히 시각적 다양성과 복합성의 분리를 고려한 COCO p 파artition에서도 고품질 생성이 가능했다.
  • 제거 실험을 통해 이중 단계 설계가 분리성 향상에 크게 기여함을 확인하였으며, 객체의 위치와 속성을 독립적으로 조작할 수 있었다.
  • 모델은 가려진 객체의 다형적 완성을 보였으며, 이는 객체 기하학과 장면 구조에 대한 암묵적 추론을 시사한다.
  • 지식 기반의 자동 예측 세그멘테이션으로 학습한 결과 뛰어난 성능를 보였으며, 고비용의 진짜 레이블에 대한 의존도를 줄였고 강건성을 입증하였다.
  • 실행 단계는 Pix2PixHD 및 SPADE와 같은 강력한 조건부 모델과 비교해도 성능가량 또는 이를 초월하였으며, 특히 세부 사항이 풍부하고 일관성 있는 장면 생성에서 뛰어난 성능를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.