[논문 리뷰] LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation
이 논문은 텍스트 프롬프트에서 의미적 레이아웃을 자동으로 생성하는 데 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 새로운 텍스트-이미지 생성 프레임워크인 LayoutLLM-T2I를 제안한다. 이는 수동 지침 없이도 높은 충실도를 유지하는 이미지 합성 가능하게 한다. LLMs로부터 레이아웃 계획을 유도하기 위해 피드백 기반 샘플링을 활용한 인라인 컨텍스트 학습을 적용하고, 세분화된 이미지 생성을 위한 관계 인식 확산 모델을 사용함으로써, COCO 2014에서 레이아웃 정확도와 이미지 충실도 측면에서 최신 기술(SoTA) 성능을 달성한다.
In the text-to-image generation field, recent remarkable progress in Stable Diffusion makes it possible to generate rich kinds of novel photorealistic images. However, current models still face misalignment issues (e.g., problematic spatial relation understanding and numeration failure) in complex natural scenes, which impedes the high-faithfulness text-to-image generation. Although recent efforts have been made to improve controllability by giving fine-grained guidance (e.g., sketch and scribbles), this issue has not been fundamentally tackled since users have to provide such guidance information manually. In this work, we strive to synthesize high-fidelity images that are semantically aligned with a given textual prompt without any guidance. Toward this end, we propose a coarse-to-fine paradigm to achieve layout planning and image generation. Concretely, we first generate the coarse-grained layout conditioned on a given textual prompt via in-context learning based on Large Language Models. Afterward, we propose a fine-grained object-interaction diffusion method to synthesize high-faithfulness images conditioned on the prompt and the automatically generated layout. Extensive experiments demonstrate that our proposed method outperforms the state-of-the-art models in terms of layout and image generation. Our code and settings are available at https://layoutllm-t2i.github.io.
연구 동기 및 목표
- 복잡한 시나리오에서 텍스트-이미지 확산 모델의 공간적 불일치 및 관계 이해 부족 문제를 해결하기 위해.
- 스케치나 스크래치와 같은 수동 지침에 의존하지 않고, 텍스트 프롬프트에서 의미적으로 정확한 레이아웃을 자동으로 생성함으로써 이를 제거하기 위해.
- LLM 기반 레이아웃 계획을 통합하여 확산 모델에 군집에서 세분화된 이미지 생성 능력을 부여하기 위해.
- 관계 인식 확산 모듈을 사용하여 세분화된 개체 간 상호작용을 모델링함으로써 이미지 충실도를 향상시키기 위해.
- LLMs로부터 레이아웃 추론를 이끌어내기 위해 인라인 컨텍스트 학습과 피드백 기반 샘플링의 효과를 검증하기 위해.
제안 방법
- 텍스트 프롬프트에서 군집적인 레이아웃을 생성하기 위해 피드백 기반 샘플링 전략을 활용한 인라인 컨텍스트 학습을 적용하여 LLMs(GPT-3.5 등)를 프롬프팅한다.
- 레이아웃과 텍스트 특징을 효과적으로 통합하기 위해 U-Net 아키텍처 내에 레이아웃 인식 공간 변환기(La-UNet)를 활용한다.
- 주어진 대상-관계-객체 삼중항을 모델링하여 확산 과정 중 공간적 및 의미적 관계 이해를 향상시키기 위해 관계 인식 상호작용 모듈을 도입한다.
- 두 단계 생성 프로세스를 적용한다: 첫 번째로 LLMs를 통해 레이아웃을 생성하고, 두 번째로 프롬프트와 생성된 레이아웃에 조건부로 고해상도 이미지를 합성한다.
- 소수의 예시를 선택하기 위해 CLIP 기반 텍스트 유사도를 사용하여 희소 프롬프팅에서의 레이아웃 정확도를 향상시킨다.
- 입력 텍스트, 추출된 관계 삼중항, 생성된 레이아웃을 별도로 임bedding하기 위해 프롬프트 인코더를 활용하여 공동 모델링을 수행한다.
실험 결과
연구 질문
- RQ1대규모 언어 모델(LLMs)은 자연어 기술 기술에서 의미적이고 공간적으로 일관된 레이아웃을 효과적으로 생성할 수 있는가?
- RQ2피드백 기반 인라인 컨텍스트 학습은 무작위 또는 최근접 이웃 샘플링 대비 레이아웃 생성 성능을 어떻게 향상시키는가?
- RQ3관계 인식 개체 상호작용 모델링을 통합할 경우, 텍스트-이미지 생성에서 이미지 충실도는 어느 정도 향상되는가?
- RQ4순수하게 자동화되고 지침이 없는 접근 방식이 인간이 제공한 레이아웃 신호에 의존하는 기존 방법을 초월할 수 있는가?
- RQ5이 설정에서 샷 수(제로샷 대비 소수샷)가 LLM의 레이아웃 계획 능력에 미치는 영향은 무엇인가?
주요 결과
- 피드백 기반 인라인 컨텍스트 학습 전략은 랜덤 및 최근접 이웃 샘플링보다 유의미하게 뛰어나며, 레이아웃 생성에서 최고의 mIoU 및 LaySim 점수를 기록한다.
- 심지어 제로샷 설정에서도 LLM은 경쟁적인 레이아웃 생성 성능를 보이며, 레이아웃 추론에 대한 강력한 소수샷 일반화 능력과 인덕티브 바이어스를 보여준다.
- 인라인 컨텍스트 예시 수를 늘릴수록 성능이 4샷까지 향상되며, 이후에는 성능 향상이 둔화되어 수익 감소 현상이 나타남을 시사한다.
- 관계 인식 상호작용 모듈은 특히 '의미적(Semantic)' 및 '혼합형(Mixed)' 관계 카테고리에서 이미지 품질 향상에 상당한 기여를 하며, 이는 교차 모odal 이해에서의 중요성을 입증한다.
- 정성적 결과에서는 LayoutLLM-T2I가 LayoutDM 및 기준 확산 모델보다 더 정확한 개체 배치와 관계 표현을 구현한 이미지를 생성함을 보이며, 복잡한 시나리오에서는 지표 레이아웃 기반 베이스라인을 초월하는 성능도 기록한다.
- 이 방법은 COCO 2014 테스트 세트에서 다섯 가지 레이아웃 카테고리인 수치적(Numerical), 공간적(Spatial), 의미적(Semantic), 복잡한(Complex), 추상적(Abstract)에서 최신 기술(SoTA) 성능을 달성하여 다양한 프롬프트 유형에 대한 강건성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.