[논문 리뷰] SpaText: Spatio-Textual Representation for Controllable Image Generation
SpaText는 희박한 분할 맵 위에서 자유형 텍스트 프롬프트를 통해 객체의 형태와 특성을 지정할 수 있도록 하는 새로운 시공간 텍스트 표현을 도입한다. CLIP 기반 임베딩을 활용하고 분류기 없는 가이던스를 다중 조건 설정으로 확장함으로써, 정밀한 레이아웃 및 콘텐츠 제어를 가능하게 하여, 메트릭스와 사용자 연구를 통해 검증된 최신 기술 수준의 이미지 생성 품질을 달성한다.
Recent text-to-image diffusion models are able to generate convincing results of unprecedented quality. However, it is nearly impossible to control the shapes of different regions/objects or their layout in a fine-grained fashion. Previous attempts to provide such controls were hindered by their reliance on a fixed set of labels. To this end, we present SpaText - a new method for text-to-image generation using open-vocabulary scene control. In addition to a global text prompt that describes the entire scene, the user provides a segmentation map where each region of interest is annotated by a free-form natural language description. Due to lack of large-scale datasets that have a detailed textual description for each region in the image, we choose to leverage the current large-scale text-to-image datasets and base our approach on a novel CLIP-based spatio-textual representation, and show its effectiveness on two state-of-the-art diffusion models: pixel-based and latent-based. In addition, we show how to extend the classifier-free guidance method in diffusion models to the multi-conditional case and present an alternative accelerated inference algorithm. Finally, we offer several automatic evaluation metrics and use them, in addition to FID scores and a user study, to evaluate our method and show that it achieves state-of-the-art results on image generation with free-form textual scene control.
연구 동기 및 목표
- 텍스트 기반 이미지 생성 확산 모델에서 객체의 형태, 위치, 특성 등을 정확히 정의할 수 없는 문제를 해결하기 위해.
- Make-A-Scene와 같은 이전 방법에서 고정 레이블 분할 맵의 한계를 극복하기 위해, 일반화 능력이 제한되고 밀도 높은 레이블링이 필요하다는 점을 해결하기 위해.
- 선택된 이미지 영역에 대해 자유형 자연어 기반 설명을 허용함으로써, 개방형 어휘, 희박한, 사용자 友好的 제어를 가능하게 하기 위해.
- 학습 데이터(전반적인 시나리오 기술)와 추론(국소적 프롬프트) 사이의 도메인 갭을 해소하기 위해 프롬프트 연결 기법을 도입하기 위해.
- 분류기 없는 가이던스를 다중 조건 설정으로 확장하여, 프롬프트와 생성된 이미지 간의 정렬을 향상시키기 위해.
제안 방법
- 사용자가 제공한 이미지 영역에 대한 자유형 텍스트 기반 기술을 사전 모델을 사용해 CLIP 임베딩 공간으로 매핑하는 CLIP 기반의 시공간 텍스트 표현을 제안한다.
- 학습 중에 사전 훈련된 파노픽 세그멘테이션 모델을 사용해 국소적 이미지 영역을 추출하고, 이를 CLIP 이미지 인코더를 통해 인코딩한다.
- 추론 시, 사용자가 제공한 국소적 텍스트 프롬프트는 CLIP 텍스트 인코더를 통해 임bed딩되고, 학습된 사전 모델을 통해 이미지 임베딩 공간으로 투영된다.
- 프롬프트 연결 기법을 도입: 추론 시 국소적 프롬프트를 전반적 프롬프트와 결합하여 학습-추론 분포 갭을 줄인다.
- 전반적 및 다수의 국소적 텍스트 임베딩을 조건으로 삼아 분류기 없는 가이던스를 다중 조건 설정으로 확장한다.
- 다중 조건 확산 샘플링의 효율성을 향상시키기 위해 가속화된 추론 알고리즘을 적용한다.
실험 결과
연구 질문
- RQ1CLIP 기반의 시공간 텍스트 표현은 텍스트 기반 이미지 생성에서 객체의 레이아웃과 특성에 대해 개방형 어휘로 정교한 제어를 가능하게 하는가?
- RQ2분할 마스크 위에서 희박하고 자유형 텍스트 프롬프트를 사용하면 고정 레이블 또는 밀도 높은 레이블 방법에 비해 제어력과 이미지 품질을 향상시키는가?
- RQ3추론 시 프롬프트 연결 기법이 학습 데이터와 사용자 입력 간의 도메인 이격을 어느 정도 완화하는가?
- RQ4확장된 분류기 없는 가이던스 기법은 전반적 및 국소적 프롬프트를 모두 고려한 다중 조건 설정에서 생성된 이미지의 정확성과 일치도를 향상시키는 데 얼마나 효과적인가?
- RQ5제안된 방법은 자동 메트릭스와 인간 평가를 통해 측정했을 때, 제어 가능한 이미지 생성 분야에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 프롬프트 연결 기법은 정성적 샘플과 정량적 메트릭스 모두에서 국소적 프롬프트와 생성된 이미지 간의 정렬을 크게 향상시킨다.
- 자유형 텍스트 기반 시나리오 제어를 위한 이미지 생성에서 최신 기술 수준의 성능을 달성했으며, Make-A-Scene 및 NTLB를 포함한 베이스라인보다 자동 메트릭스와 사용자 연구 모두에서 뛰어난 성능을 보였다.
- 사용자 연구 결과, 기존 방법에 비해 SpaText는 사용자 의도에 더 잘 부합하는 객체 레이아웃과 특성을 생성함을 확인했다.
- 고정 레이블 세트에 포함되지 않은 새로운 객체 유형에 대해서도 모델이 잘 일반화됨을 보여주며, 폐쇄형 어휘 대비 개방형 어휘 접근의 우수성을 입증했다.
- 확장된 분류기 없는 가이던스 메커니즘은 효과적인 다중 조건 제거를 가능하게 하여 생성 품질과 프롬프트 준수도를 향상시켰다.
- FID 및 새로운 시나리오 특화 메트릭스를 포함한 자동 평가 메트릭스는 SpaText가 다양하고 정확하며 제어 가능한 이미지를 생성하는 데 뛰어난 성능을 보임을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.