Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Image Composition for Complex Scene Generation

Zuopeng Yang, Daqing Liu|arXiv (Cornell University)|2022. 06. 02.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 공간 레이아웃 사전 지식을 활용하여 복잡한 시나리오 생성에서 개체 수준의 관계와 패치 수준의 인스턴스 구조를 분리하는 Focal Attention를 갖춘 Transformer(TwFA)를 제안한다. 개체 토큰을 위한 전역 관계와 개체 바운딩 박스 내부의 패치 토큰을 위한 국소 구조에만 주의를 집중함으로써 TwFA는 COCO-stuff에서 FID 점수 22.15, Visual Genome에서 17.74의 최신 기준(SOTA) 성능을 달성하며, 극소수의 데이터로도 효과적인 생성을 가능하게 한다.

ABSTRACT

We present a method that achieves state-of-the-art results on challenging (few-shot) layout-to-image generation tasks by accurately modeling textures, structures and relationships contained in a complex scene. After compressing RGB images into patch tokens, we propose the Transformer with Focal Attention (TwFA) for exploring dependencies of object-to-object, object-to-patch and patch-to-patch. Compared to existing CNN-based and Transformer-based generation models that entangled modeling on pixel-level&patch-level and object-level&patch-level respectively, the proposed focal attention predicts the current patch token by only focusing on its highly-related tokens that specified by the spatial layout, thereby achieving disambiguation during training. Furthermore, the proposed TwFA largely increases the data efficiency during training, therefore we propose the first few-shot complex scene generation strategy based on the well-trained TwFA. Comprehensive experiments show the superiority of our method, which significantly increases both quantitative metrics and qualitative visual realism with respect to state-of-the-art CNN-based and transformer-based methods. Code is available at https://github.com/JohnDreamer/TwFA.

연구 동기 및 목표

  • 다수의 객체, 정확한 관계, 세밀한 질감을 갖춘 사진 수준의 현실감 있는 복잡한 시나리오 생성에 도전한다.
  • CNN 기반 및 Transformer 기반 방법에서 패치 수준과 개체 수준의 표현을 동시에 학습하는 데서 비롯하는 모델링의 엔트로피 문제를 해결한다.
  • 개체 수준과 패치 수준의 구성 모델링을 분리함으로써 극소수 학습에서의 데이터 효율성을 향상시킨다.
  • 최소한의 감독 신호로도 레이아웃 조건(바운딩 박스 및 카테고리)에 기반한 고해상도이고 제어 가능한 이미지 생성을 가능하게 한다.

제안 방법

  • 사전에 훈련된 압축 모델을 사용하여 입력 RGB 이미지를 이산 패치 토큰으로 압축한다.
  • 개체 토큰과 패치 토큰을 별도로 모델링하기 위해 개체 토큰과 패치 토큰을 구분하는 Focal Attention를 갖춘 Transformer(TwFA)를 도입한다.
  • 각 개체 토큰이 다른 모든 개체 토큰에 주의를 기울이는 개체 수준의 주의를 적용하여 전역 공간적 관계를 포착한다.
  • 각 패치 토큰이 속한 개체와 동일한 개체의 바운딩 박내의 다른 패치 토큰들만 주의를 기울이는 패치 수준의 주의를 적용한다.
  • 레이아웃 유도 연결 행렬을 사용하여 주의 제약 조건을 강제 적용함으로써 관련 있는 토큰들만 주의를 기울이게 하여 노이즈를 줄이고 분류 정확도를 향상시킨다.
  • 새로운 개체 카테고리의 소수의 이미지로 사전에 훈련된 TwFA 모델을 미세조정하여 극소수 복잡한 시나리오 생성을 가능하게 한다.

실험 결과

연구 질문

  • RQ1자기 주의 메커니즘을 재구성하여 이미지 생성에서 개체 수준의 관계와 패치 수준의 인스턴스 구조를 분리할 수 있는가?
  • RQ2주의 메커니즘에 공간 레이아웃 사전 지식을 통합하면 생성 품질과 데이터 효율성이 향상되는가?
  • RQ3분리된 주의 메커니즘이 극소수의 훈련 데이터로도 새로운 개체 카테고리에 대해 효과적인 이미지 생성을 가능하게 하는가?
  • RQ4포커스 주의는 복잡한 시나리오 구성 모델링에서 표준 자기 주의 및 격자 기반 주의보다 어떻게 비교되는가?

주요 결과

  • TwFA는 COCO-stuff 데이터셋에서 FID 점수 22.15를 달성하여 이전 SOTA인 29.56보다 25.1% 향상되었다.
  • Visual Genome 데이터셋에서 TwFA는 FID를 19.14에서 17.74로 낮추어 상대적 개선률 7.3%를 기록했다.
  • 극소수 L2I 생성에서 TwFA는 50장의 샘플로 FID 31.53과 개체별 FID(Obj-FID) 26.73을 달성했으며, 기준 모델인 Grid16* (FID: 37.47, Obj-FID: 32.81)를 능가했다.
  • 제거 실험 결과, 개체 간 상호작용은 전역 구조 추론에 핵심적임을 확인했고, 개체-패치 및 패치-패치 상호작용은 사실감 있는 품질 향상에 기여함을 입증했다.
  • 제안된 포커스 주의 메커니즘은 격자 기반 주의(Grid4, Grid16)를 능가하며, 특히 세밀한 디테일과 개체의 무결성을 유지하는 데 뛰어난 시각적 품질을 제공한다.
  • 시각화 결과 TwFA는 기준 모델 대비 더 선명하고 더 잘 정렬된 개체(예: 얼굴, 펠리카, 펠리카)를 생성함을 확인했으며, 새로운 개체 데이터가 2~50장일 때도 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.