Skip to main content
QUICK REVIEW

[논문 리뷰] Kosmos-G: Generating Images in Context with Multimodal Large Language Models

Xichen Pan, Li Dong|arXiv (Cornell University)|2023. 10. 04.
Computational and Text Analysis Methods인용 수 6
한 줄 요약

Kosmos-G는 다중모달 대규모 언어 모델로, 텍스트 기반 앵커링과 점수 증류 지도 훈련을 통해 비전-언어 모델의 출력 공간을 CLIP와 정렬함으로써 이미지 디코더를 수정하지 않고도 제로샷, 다중 엔티티 기반 주제 기반 이미지 생성을 가능하게 한다. 이는 ControlNet 및 LoRA와 같은 U-Net 기반 기법과의 원활한 통합을 가능하게 하며, 텍스트-to-이미지 및 주제 기반 생성에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recent advancements in subject-driven image generation have made significant strides. However, current methods still fall short in diverse application scenarios, as they require test-time tuning and cannot accept interleaved multi-image and text input. These limitations keep them far from the ultimate goal of "image as a foreign language in image generation." This paper presents Kosmos-G, a model that leverages the advanced multimodal perception capabilities of Multimodal Large Language Models (MLLMs) to tackle the aforementioned challenge. Our approach aligns the output space of MLLM with CLIP using the textual modality as an anchor and performs compositional instruction tuning on curated data. Kosmos-G demonstrates an impressive capability of zero-shot subject-driven generation with interleaved multi-image and text input. Notably, the score distillation instruction tuning requires no modifications to the image decoder. This allows for a seamless substitution of CLIP and effortless integration with a myriad of U-Net techniques ranging from fine-grained controls to personalized image decoder variants. We posit Kosmos-G as an initial attempt towards the goal of "image as a foreign language in image generation." The code can be found at https://aka.ms/Kosmos-G

연구 동기 및 목표

  • 일반화된 비전-언어-to-이미지(VL2I) 생성의 격차, 특히 다중 엔티티 입력에 대한 격차를 해소하기 위해.
  • 여러 이미지에 걸쳐 혼합된 비전-언어 프롬프트에서 제로샷, 주제 기반 이미지 생성을 가능하게 하기 위해.
  • U-Net 아키텍처를 수정하지 않고도 다중모달 LLM 출력을 확산 기반 이미지 디코더와 정렬하는 방법을 개발하기 위해.
  • 세부 제어 및 개인화를 위해 기존 U-Net 기법(예: ControlNet 및 LoRA)과 원활한 통합을 가능하게 하기 위해.

제안 방법

  • 모델는 '지시 이전에 정렬' 전략을 사용하며, 먼저 다중모달 언어 모델링을 통해 시각과 언어 표현을 통합하는 데에 사전 훈련을 수행한다.
  • 텍스트 모odal을 다리로 삼아 다중모달 LLM의 출력 공간을 CLIP의 텍스트 인코더에 앵커링함으로써 의미적 정렬을 가능하게 한다.
  • 고정된 이미지 디코더의 데이터 분포를 증류하기 위해 점수 증류 지도 훈련을 적용하여 다중모달 LLM에 미분 가능한 기울기를 제공한다.
  • 캡션과 분할된 이미지의 혼합 입력을 수용하며, 각 엔티티 뒤에는 해당하는 이미지가 이어진다.
  • 이미지 디코더(U-Net 또는 VAE)에 대한 수정이 없어, CLIP를 어떤 확산 기반 시스템에도 즉시 교체할 수 있다.
  • 다중모달 LLM이 맥락 내에서 여러 이미지와 텍스트를 인지하고 추론할 수 있는 능력을 활용해 제로샷 다중 엔티티 생성을 지원한다.

실험 결과

연구 질문

  • RQ1다중모달 LLM이 이미지 디코더를 미세조정하지 않고도 일반화된, 다중 이미지 기반 비전-언어 입력으로 고해상도 이미지를 생성할 수 있는가?
  • RQ2비전-언어 모델이 다중 엔티티를 통해 제로샷 주제 기반 이미지 생성을 얼마나 잘 수행할 수 있는가?
  • RQ3U-Net 아키텍처에 변화 없이 점수 증류 지도 훈련을 통해 CLIP를 확산 모델에서 교체할 수 있는가?
  • RQ4조합적 지도 훈련과 CLIP 기반 정렬이 이미지 생성 품질과 정밀도에 미치는 영향은 무엇인가?
  • RQ5Kosmos-G는 ControlNet 및 LoRA와 같은 기존 U-Net 기법과 원활하게 통합되어 세부 제어 및 개인화를 향상시킬 수 있는가?

주요 결과

  • Kosmos-G는 제로샷 주제 기반 생성에서 CLIP 정렬 모델인 GILL-8B(12.20)와 Emu-14B(11.66)를 능가하는 DreamBench 점수 10.99를 기록했다.
  • MS-COCO에서 Kosmos-G는 CLIP 정렬 VL2I 모델 중에서 가장 낮은 FID 점수 9.34를 기록했으며, 기본 Stable Diffusion v1.5 수준의 성능을 달성했다.
  • 엔드 투 엔드 미세조정은 의미 있는 이미지를 생성하지 못해, 제안된 정렬 및 지도 훈련 파이프라인의 필요성을 입증했다.
  • 지시 훈련 없이 Kosmos-G는 의미적으로 정렬된 이미지만 생성할 뿐 실체를 충실하게 재현하지 못해, 훈련 단계의 중요성을 강조한다.
  • 이 모델은 이전 방법이 달성하지 못했던 제로샷 다중 엔티티 주제 기반 생성을 가능하게 한다.
  • Qualitative 결과에서 ControlNet 및 LoRA 변종과의 즉시 통합이 가능하며, 제어력과 스타일링 향상이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.