[논문 리뷰] MultiFusion: Fusing Pre-Trained Models for Multi-Lingual, Multi-Modal Image Generation
MultiFusion는 사전 훈련된 언어, 시각, 임bedding 모델을 융합하여 복잡하고 번갈아가며 혼합된 텍스트 및 이미지 프롬프트를 위한 이미지 생성을 가능하게 하는 다국어, 다모odal 확산 모델을 소개한다. 어댑터와 주의 조작을 통해 사전 훈련된 구성 요소를 정렬함으로써, 다국어 훈련을 필요로 하지 않고도 다국어 기능을 달성하며, 전체 훈련 계산 자원을 기존 훈련 방식 대비 95% 감소시킨다.
The recent popularity of text-to-image diffusion models (DM) can largely be attributed to the intuitive interface they provide to users. The intended generation can be expressed in natural language, with the model producing faithful interpretations of text prompts. However, expressing complex or nuanced ideas in text alone can be difficult. To ease image generation, we propose MultiFusion that allows one to express complex and nuanced concepts with arbitrarily interleaved inputs of multiple modalities and languages. MutliFusion leverages pre-trained models and aligns them for integration into a cohesive system, thereby avoiding the need for extensive training from scratch. Our experimental results demonstrate the efficient transfer of capabilities from individual modules to the downstream model. Specifically, the fusion of all independent components allows the image generation module to utilize multilingual, interleaved multimodal inputs despite being trained solely on monomodal data in a single language.
연구 동기 및 목표
- 임의로 번갈아가며 혼합된 다모달 및 다국어 입력을 통해 표현력 있고 복잡한 이미지 생성을 가능하게 하기 위해.
- 다국어 훈련 데이터가 필요 없이 사전 훈련된 언어 모델의 다국어 기능을 확산 모델에 전이하기 위해.
- 모듈러하고 사전 훈련된 구성 요소를 활용하여 다국어 및 다모달 확산 모델의 훈련 계산 자원을 줄이기 위해.
- 다모달 프롬프팅에서 복합적 이해 능력을 평가하기 위한 벤치마크를 개발하기 위해.
- 다양한 사전 훈련된 모델을 통합하여 통합된 생성 시스템에 유연하고 모듈러한 프레임워크를 제공하기 위해.
제안 방법
- MultiFusion는 어댑터를 통해 시각 및 의미 검색에 맞춤형 훈련된 디코더 언어 모델을 핵심으로 사용한다.
- 어댑터와 편향 모듈을 통해 시각 및 텍스트 인코더를 정렬하여 확산 모델 내에서 교차 주의 조건부 훈련을 가능하게 한다.
- 교차 주의 메커니즘은 추론 시점에 언어 모델의 임베딩을 기반으로 확산 모델을 조건부로 설정하며, 다모달 입력을 활용한다.
- 이미지 생성 중 시각적 및 텍스트적 입력의 영향을 제어하기 위해 주의 조작 기법을 적용한다.
- 모델은 영어 전용 단일 언어 데이터로 훈련되며, 다국어 기능은 언어 모델의 인코더를 통해 전이된다.
- 다모달 프롬프팅에서 복합 일반화 능력을 평가하기 위해 새로운 벤치마크인 MCC-250을 도입한다.

실험 결과
연구 질문
- RQ1확산 모델은 다모달 또는 다국어 훈련 데이터가 없이도 임의로 번갈아가며 혼합된 텍스트 및 이미지 프롬프트를 사용하여 고품질의 이미지를 생성할 수 있는가?
- RQ2사전 훈련된 언어 모델의 다국어 기능이 하류 이미지 생성 작업으로 얼마나 잘 전이될 수 있는가?
- RQ3주의 조작 기법은 이미지 생성 중 시각적 및 텍스트적 입력의 영향을 얼마나 효과적으로 제어하는가?
- RQ4모듈러하고 어댑터 기반의 사전 훈련된 모델 융합 방식은 훨씬 더 적은 계산 자원으로도 종단 간 훈련된 모델과 유사한 성능을 달성할 수 있는가?
- RQ5모델은 다중 모달 및 다국어를 조합한 복합적 프롬프트에 얼마나 잘 일반화되는가?
주요 결과
- MultiFusion는 영어 데이터로만 훈련되었음에도 불구하고 다섯 개의 언어에서 텍스트와 이미지를 번갈아가며 혼합한 프롬프트를 사용하여 고해상도 이미지를 성공적으로 생성하였다.
- 모델은 기반 언어 모델의 다국어 기능을 활용하여 다국어 이미지 생성을 달성하였으며, 다국어 미세조정이 필요 없게 되었다.
- 어댑터와 주의 조작의 사용은 이미지 생성 중 시각적 및 텍스트적 입력의 영향을 정밀하게 제어할 수 있도록 하였다.
- 기존에 동일한 확산 모델을 처음부터 훈련하는 방식 대비 훈련 계산 자원을 95% 이상 감소시켰다.
- MCC-250 벤치마크는 MultiFusion이 복잡한 다모달 프롬프트에 대해 복합적으로 일반화됨을 보여주었으며, 복합적 이해 능력에서 베이스라인 모델을 능가하였다.
- 정확한 이미지 복제 기능에는 한계가 있으나, 모델은 입력 이미지를 스타일적 또는 구조적 참고 자료로 효과적으로 활용하였으며, 성능은 입력 이미지의 품질과 구성에 민감하게 영향을 받았다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.