[논문 리뷰] Diffusion-Based Scene Graph to Image Generation with Masked Contrastive Pre-Training
이 논문은 마스크된 자동에코와 대비 학습을 사용하여 사전 훈련한 시나리오 그래프 임베딩을 통해 시나리오 그래프와 이미지 간의 정렬을 향상시키는 SGDiff라는 확산 기반 이미지 생성 모델을 제안한다. 이 방법은 Visual Genome 및 COCO-Stuff에서 최신 기술을 초월하여 256×256 이미지 생성에서 인ception 스코어(16.4)와 FID(26.0)로 최고 성능을 기록하며, 시나리오 그래프 편집을 통한 의미적 조작 기능도 제공한다.
Generating images from graph-structured inputs, such as scene graphs, is uniquely challenging due to the difficulty of aligning nodes and connections in graphs with objects and their relations in images. Most existing methods address this challenge by using scene layouts, which are image-like representations of scene graphs designed to capture the coarse structures of scene images. Because scene layouts are manually crafted, the alignment with images may not be fully optimized, causing suboptimal compliance between the generated images and the original scene graphs. To tackle this issue, we propose to learn scene graph embeddings by directly optimizing their alignment with images. Specifically, we pre-train an encoder to extract both global and local information from scene graphs that are predictive of the corresponding images, relying on two loss functions: masked autoencoding loss and contrastive loss. The former trains embeddings by reconstructing randomly masked image regions, while the latter trains embeddings to discriminate between compliant and non-compliant images according to the scene graph. Given these embeddings, we build a latent diffusion model to generate images from scene graphs. The resulting method, called SGDiff, allows for the semantic manipulation of generated images by modifying scene graph nodes and connections. On the Visual Genome and COCO-Stuff datasets, we demonstrate that SGDiff outperforms state-of-the-art methods, as measured by both the Inception Score and Fréchet Inception Distance (FID) metrics. We will release our source code and trained models at https://github.com/YangLing0818/SGDiff.
연구 동기 및 목표
- 시나리오 그래프와 생성된 이미지 간의 정렬 불일치 문제를 해결하기 위해, 시나리오 레이아웃과 같은 수작업으로 만든 중간 표현 방식의 영향을 줄이기 위해.
- 해당 이미지와의 정렬을 명시적으로 최적화하는 시나리오 그래프 임베딩을 학습하여 생성 품질과 구조적 준수성을 향상시키기 위해.
- 시나리오 그래프 편집을 통해 의미적 이미지 조작을 가능하게 하기 위해 분리된, 예측 가능한 임베딩을 학습하기 위해.
- 종단 간에 학습된 임베딩이 질적 및 양적 이미지 생성 벤치마크에서 수작업으로 설계된 시나리오 레이아웃 표현보다 우수한 성능을 보임을 입증하기 위해.
제안 방법
- 손상된 이미지 영역을 복원하기 위해, 마스크되지 않은 영역과 시나리오 그래프 임베딩을 기반으로 한 마스크된 자동에코 손실을 사용하여 시나리오 그래프 인코더를 사전 훈련한다.
- 시나리오 그래프에 부합하는 이미지-그래프 쌍과 부합하지 않는 쌍을 구분하기 위해 대비 학습을 적용하여 전반적인 구조적 정렬을 향상시킨다.
- 국소적(마스크된 자동에코) 및 전역적(대비) 임베딩을 통합하여 예측 능력을 향상시킨 통합 표현을 구성한다.
- 사전 훈련된 시나리오 그래프 임베딩을 조건으로 하여 잠재 확산 모델을 사용하여 고해상도이자 정확한 구조를 가진 이미지를 생성한다.
- 학습된 임베딩을 활용하여 시나리오 그래프의 노드와 관계를 수정함으로써 의미적 조작을 가능하게 한다.
- IS 및 FID 메트릭을 사용하여 Visual Genome 및 COCO-Stuff 데이터셋에서 모델을 훈련하고 평가한다.
실험 결과
연구 질문
- RQ1마스크된 대비 사전 훈련을 통한 시나리오 그래프 임베딩이 입력 시나리오 그래프와의 정렬성 및 이미지 생성 품질을 향상시키는가?
- RQ2국소적(마스크된 자동에코) 및 전역적(대비) 임베딩 구성 요소가 이미지 생성 성능에 각각 어떻게 기여하는가?
- RQ3종단 간에 학습된 시나리오 그래프 임베딩이 시나리오 그래프에서 이미지 생성에서 수작업으로 설계된 시나리오 레이아웃 표현보다 우수한가?
- RQ4학습된 임베딩이 시나리오 그래프 편집을 통해 세밀한 의미적 이미지 조작을 지원하는가?
주요 결과
- 마스크된 자동에코와 대비 사전 훈련의 조합은 그래프-이미지 검색에서 73.4%의 정확도, 이미지-그래프 검색에서 74.1%의 정확도를 기록하여 개별 손실보다 뛰어난 성능을 보였다.
- SGDiff는 COCO-Stuff 데이터셋에서 인ception 스코어 16.4 ± 0.6과 FID 26.0을 달성하여, 원-핫 인코딩(IS: 10.1, FID: 87.1) 및 레이아웃 기반(IS: 12.3, FID: 52.7) 기준선을 모두 능가했다.
- 마스크된 사전 훈련은 국소적 구조 생성을 향상시켜 더 세밀한 물체 세부 사항을 가진 이미지를 생성했고, 대비 사전 훈련은 전반적인 구조적 준수성을 향상시켰다.
- 제거 실험을 통해 마스크된 자동에코와 대비 손실 모두가 필수적임을 확인하였으며, 두 손실의 조합이 가장 뛰어난 성능을 냈다.
- 질적 결과에서는 SGDiff가 이전 방법들보다 더 현실적이며 그래프 준수성이 높은 이미지를 생성하는 것으로 나타났다. 특히 '먹고 있다' 또는 '보는'과 같은 복잡한 관계에서 두드러진 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.