Skip to main content
QUICK REVIEW

[논문 리뷰] Mini-DALLE3: Interactive Text to Image by Prompting Large Language Models

Lai Zeqiang, Zhu Xizhou|arXiv (Cornell University)|2023. 10. 11.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)을 오프더섀프 텍스트-이미지 디퓨전 모델과 통합함으로써, 모델 미세조정 없이도 자연어 대화를 통해 반복적인 상호작용을 통해 고품질의 맥락 인식 이미지 생성이 가능한 프롬프팅 기반 프레임워크인 Mini-DALL·E 3을 소개한다. 사용자는 자연어 대화를 통해 반복적으로 이미지를 개선할 수 있으며, 이는 추론 및 질의응답 기능을 포함한 LLM의 핵심 능력을 유지하면서도 사용자 우아함을 향상시킨다.

ABSTRACT

The revolution of artificial intelligence content generation has been rapidly accelerated with the booming text-to-image (T2I) diffusion models. Within just two years of development, it was unprecedentedly of high-quality, diversity, and creativity that the state-of-the-art models could generate. However, a prevalent limitation persists in the effective communication with these popular T2I models, such as Stable Diffusion, using natural language descriptions. This typically makes an engaging image hard to obtain without expertise in prompt engineering with complex word compositions, magic tags, and annotations. Inspired by the recently released DALLE3 - a T2I model directly built-in ChatGPT that talks human language, we revisit the existing T2I systems endeavoring to align human intent and introduce a new task - interactive text to image (iT2I), where people can interact with LLM for interleaved high-quality image generation/edit/refinement and question answering with stronger images and text correspondences using natural language. In addressing the iT2I problem, we present a simple approach that augments LLMs for iT2I with prompting techniques and off-the-shelf T2I models. We evaluate our approach for iT2I in a variety of common-used scenarios under different LLMs, e.g., ChatGPT, LLAMA, Baichuan, and InternLM. We demonstrate that our approach could be a convenient and low-cost way to introduce the iT2I ability for any existing LLMs and any text-to-image models without any training while bringing little degradation on LLMs' inherent capabilities in, e.g., question answering and code generation. We hope this work could draw broader attention and provide inspiration for boosting user experience in human-machine interactions alongside the image quality of the next-generation T2I systems.

연구 동기 및 목표

  • 기존 텍스트-이미지 모델의 낮은 사용자 우량성 문제를 해결하기 위해, 고품질 출력을 얻기 위해 전문가 수준의 프롬프트 엔지니어링이 요구되는 문제를 해결한다.
  • 비전문가 사용자가 원하는 이미지를 효과적으로 생성하는 데 걸림돌이 되는 자연어 이해 능력 부족과 프롬프트 설정의 복잡성 문제를 극복한다.
  • 사용자가 LLM 기반 에이전트와 다중 터미널 대화를 통해 반복적으로 이미지를 생성, 편집, 개선하는 상호작용적 텍스트-이미지(iT2I) 생성이라는 새로운 작업을 도입한다.
  • 모델 재학습 없이도 기존의 LLM과 텍스트-이미지 모델 조합에 iT2I 기능을 저비용으로 통합할 수 있도록 한다.
  • 질의응답 및 코드 생성과 같은 LLM의 본질적 능력을 유지하면서도 이미지 생성 및 편집 기능을 추가한다.

제안 방법

  • LLM이 디퓨전 기반 T2I 모델에 적절한 텍스트 프롬프트를 생성하도록 유도하기 위해 소수 샘플 프롬프팅과 사고의 사슬 프롬프팅을 사용한다.
  • 다중 터미널 대화 환경에서 오프더섀프 T2I 모델(예: Stable Diffusion)을 LLM과 통합하여 이미지 생성, 편집, 개선을 지원한다.
  • 대화의 맥락을 유지하여 캐릭터 정체성 또는 시점 요소와 같은 요소의 일관성을 확보함으로써 다중 터미널 이미지 편집의 일관성을 유지한다.
  • 자연어 명령어(예: '개를 더 크게 해줘' 또는 '스티커가 되지 마')를 T2I 모델과 호환 가능한 구조적 프롬프트로 변환하는 프롬프팅 파이프라인을 설계한다.
  • GPT-3.5, GPT-4, Claude 3, LLAMA2, Baichuan2, Qwen, InternLM 등 다양한 LLM을 대상으로 일반화 능력과 강건성을 평가한다.
  • 모델 미세조정 없이도 프롬프팅 엔지니어링에 의존하는 제로샷 평가 설정을 통해 iT2I 기능을 활성화한다.
Figure 2 : The evolution of image generation systems.
Figure 2 : The evolution of image generation systems.

실험 결과

연구 질문

  • RQ1프롬프팅 기법을 통해 기존 LLM이 미세조정 없이도 상호작용적이고 다중 터미널 텍스트-이미지 생성을 지원할 수 있는가?
  • RQ2상용 및 오픈소스 LLM이 자연어 상호작용을 통해 맥락적으로 정확하고 고품질의 이미지 프롬프트를 얼마나 잘 생성하는가?
  • RQ3제안된 프롬프팅 기반 접근법이 질문-응답 및 코드 생성과 같은 LLM의 원래 기능을 어느 정도 유지하는가?
  • RQ4대화 중 여러 차례의 편집에도 불구하고 시각적 일관성을 유지할 수 있는가(예: 캐릭터 정체성 또는 시점 구조 유지)?
  • RQ5상용 모델에 비해 오픈소스 LLM은 iT2I 작업을 수행하는 데 어떤 한계를 지닌다?

주요 결과

  • GPT-3.5, GPT-4, Claude 3 등 상용 LLM은 적절한 이미지 프롬프트를 성공적으로 생성하고 상호작용적 iT2I 기능을 프롬프팅을 통해 유연하게 수행함을 입증했다.
  • 오픈소스 LLM 중 Baichuan2-13B-Chat 가 가장 우수한 성능을 보였고, Qwen과 InternLM는 프롬프팅에도 불구하고 이미지 생성을 거부하는 경우가 많았다.
  • ChatGLM2-6B-Chat 는 이미지를 생성했지만 텍스트-이미지 대응이 잘못되어 프롬프트 정렬 문제를 노출시켰다.
  • 프롬프팅 기반 접근법을 통해 재학습 없이도 어떤 LLM과 T2I 모델 조합에도 iT2I 기능을 제로샷으로 통합할 수 있었다.
  • 이 방법은 질문-응답 및 코드 생성과 같은 핵심 LLM 기능을 최소한의 성능 저하 없이 유지했다.
  • MMLU 평가 결과, 프롬프팅 접근법이 LLM 성능에 크게 영향을 주지 않았으며, 평균 점수는 소수 샘플 프롬프팅 기준 59.34점, 제로샷 기준 56.37점으로 추론 능력이 잘 유지됨을 보여주었다.
Figure 3 : Illustrations of different human-machine interfaces for T2I systems.
Figure 3 : Illustrations of different human-machine interfaces for T2I systems.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.