Skip to main content
QUICK REVIEW

[논문 리뷰] AltDiffusion: A Multilingual Text-to-Image Diffusion Model

Fulong Ye, Guang Liu|arXiv (Cornell University)|2023. 08. 19.
Image Retrieval and Classification TechniquesComputer Science인용 수 3
한 줄 요약

AltDiffusion는 다국어 텍스트 인코더를 힌트로 삼고, 두 단계 학습 방식을 통해 사전 학습된 영어 전용 확산 모델을 미세조정하여 18개의 언어(저자원 및 문화적으로 특수한 언어 포함)를 지원하는 다국어 텍스트-이미지 확산 모델이다. 이 모델은 번역 기반의 Stable Diffusion와 기존의 다국어 모델보다 문화적으로 특수한 개념을 이해하는 데서 뛰어나며, 높은 이미지 품질을 유지한다.

ABSTRACT

Large Text-to-Image(T2I) diffusion models have shown a remarkable capability to produce photorealistic and diverse images based on text inputs. However, existing works only support limited language input, e.g., English, Chinese, and Japanese, leaving users beyond these languages underserved and blocking the global expansion of T2I models. Therefore, this paper presents AltDiffusion, a novel multilingual T2I diffusion model that supports eighteen different languages. Specifically, we first train a multilingual text encoder based on the knowledge distillation. Then we plug it into a pretrained English-only diffusion model and train the model with a two-stage schema to enhance the multilingual capability, including concept alignment and quality improvement stage on a large-scale multilingual dataset. Furthermore, we introduce a new benchmark, which includes Multilingual-General-18(MG-18) and Multilingual-Cultural-18(MC-18) datasets, to evaluate the capabilities of T2I diffusion models for generating high-quality images and capturing culture-specific concepts in different languages. Experimental results on both MG-18 and MC-18 demonstrate that AltDiffusion outperforms current state-of-the-art T2I models, e.g., Stable Diffusion in multilingual understanding, especially with respect to culture-specific concepts, while still having comparable capability for generating high-quality images. All source code and checkpoints could be found in https://github.com/superhero-7/AltDiffuson.

연구 동기 및 목표

  • 기존의 텍스트-이미지 확산 모델이 영어, 중국어, 일본어를 중심으로 제한된 언어 집합만 지원하는 데서 비롯되는 한계를 해결한다.
  • 전 세계 18개의 다양한 언어에서 고품질의 이미지 생성을 가능하게 하며, 이는 제1어모 46.94%, 제2어모 27.64%의 인구를 커버한다.
  • 특히 이름이나 예술적 전통과 같은 문화적으로 특수한 개념에서 발생하는 번역 유도 오류와 정보 손실을 해결한다.
  • 일반적인 이미지 품질과 다국어 텍스트-이미지 생성에서 문화적으로 특수한 개념 이해 능력을 평가하기 위한 종합적인 벤치마크를 개발한다.
  • ControlNet 및 LoRA와 같은 기존의 후행 도구와의 호환성을 확보하여 실생활 응용에서 보다 정교한 제어 기능을 제공한다.

제안 방법

  • 지식 정렬을 활용하여 18개의 언어를 공통된 의미 공간에 통합하는 다국어 텍스트 인코더를 학습한다.
  • 고정된 다국어 텍스트 인코더를 사전 학습된 영어 전용 확산 모델(예: Stable Diffusion)에 통합하여 텍스트 인코더 헤드로 활용한다.
  • 두 단계 학습 방식을 적용한다: 첫 번째 단계에서는 LAION-5B를 사용하여 UNet의 교차 어텐션 레이어 내부의 K 및 V 행렬만 미세조정하여 교차 어텐션 정렬을 확보하고, 두 번째 단계에서는 UNet의 모든 파라미터를 해冻하고 LAION Aesthetics 데이터셋을 사용하여 이미지 품질 향상을 위한 미세조정을 수행한다.
  • 학습 중 분류기 없는 가이던스를 활용하여 생성 품질과 다양성을 향상시킨다.
  • 초기 정렬을 위해 다국어 데이터셋(LAION-5B)을 사용하고, 최종 보정을 위해 고품질 서브셋(LAION Aesthetics)을 활용한다.
  • 기존 모델 아키텍처와 가중치 구조를 유지함으로써 ControlNet 및 LoRA와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1고품질의 이미지 품질과 의미 정렬을 유지하면서 18개의 다양한 언어에서 효과적으로 다국어 텍스트-이미지 확산 모델을 학습할 수 있는가?
  • RQ2특히 문화적으로 특수한 개념에서 번역 기반 접근 방식과 비교해 볼 때, 모델의 다국어 이해 능력은 어떠한가?
  • RQ3번역 또는 재인코딩 없이 혼합 언어 프롬프트에 대해 얼마나 잘 일반화되는가?
  • RQ4두 단계 학습 전략이 다국어 환경에서 교차 어텐션 정렬과 이미지 품질 향상 간의 균형을 효과적으로 달성할 수 있는가?
  • RQ5기존의 전통 예술, 이름, 지역적 관용어 등 문화적으로 특수한 개념에 대해 다양한 언어에서 모델의 성능은 어떠한가?

주요 결과

  • MC-18 벤치마크에서 AltDiffusion는 번역 기반의 Stable Diffusion보다 CLIP 유사도(CLIP Sim)에서 전반적으로 높은 성능을 보이며, 평균 점수 차이가 0.769 대 0.231이다.
  • MC-18 벤치마크에서 AltDiffusion는 문화적으로 특수한 개념 이해(평균 4.125)와 이미지-텍스트 일致성(평균 3.775) 모두에서 번역 기반 SD보다 높은 인간 평가 점수를 기록하여 다국어 이해 능력이 뛰어나다는 것을 시사한다.
  • MG-18에서 FID, IS, CLIP Sim 점수에서 기존의 다국어 모델인 Taiyi 및 일본어 SD를 뛰어넘어 일반적인 이미지 품질과 정렬에서 최고 수준의 성능을 보였다.
  • 번역 기반의 SD는 기름그림이나 사실적인 이미지처럼 스타일이 어긋나는 결과를 생성하는 반면, AltDiffusion는 전통 중국화나 일본 벚꽃 풍경 등 문화적으로 정확한 출력을 생성한다.
  • AltDiffusion는 중국어-한국어, 태국어-영어 등 혼합 언어 프롬프트를 성공적으로 지원하여 번역 단계 없이도 일관되고 맥락에 맞는 이미지를 생성한다.
  • ControlNet 및 LoRA와의 완전한 호환성을 확보하여 아키텍처 수정 없이도 고도의 제어 기능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.