Skip to main content
QUICK REVIEW

[논문 리뷰] Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants

Tianyu Yu, Jinyi Hu|arXiv (Cornell University)|2023. 10. 01.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 사전 훈련된 시각-언어 모델을 '즉시 사용 가능한' 다리로 활용하여 시각 인코더와 대규모 언어 모델 간의 연결을 구축하는 Muffin이라는 새로운 프레임워크를 제안한다. 이로 인해 추가적인 특징 정렬 훈련이 필요 없어진다. 또한, 다양한 데이터셋의 상호보완적인 주석을 융합하여 만든 110만 건의 멀티모달 지시 데이터셋인 UniMM-Chat을 도입하였으며, 이는 LLaVA나 InstructBLIP과 같은 모델들을 능가하는 최신 기술 수준의 성능을 다양한 시각-언어 작업에서 달성할 수 있게 한다.

ABSTRACT

Recent Multimodal Large Language Models (MLLMs) exhibit impressive abilities to perceive images and follow open-ended instructions. The capabilities of MLLMs depend on two crucial factors: the model architecture to facilitate the feature alignment of visual modules and large language models; the multimodal instruction tuning datasets for human instruction following. (i) For the model architecture, most existing models introduce an external bridge module to connect vision encoders with language models, which needs an additional feature-alignment pre-training. In this work, we discover that compact pre-trained vision language models can inherently serve as ``out-of-the-box'' bridges between vision and language. Based on this, we propose Muffin framework, which directly employs pre-trained vision-language models to act as providers of visual signals. (ii) For the multimodal instruction tuning datasets, existing methods omit the complementary relationship between different datasets and simply mix datasets from different tasks. Instead, we propose UniMM-Chat dataset which explores the complementarities of datasets to generate 1.1M high-quality and diverse multimodal instructions. We merge information describing the same image from diverse datasets and transforms it into more knowledge-intensive conversation data. Experimental results demonstrate the effectiveness of the Muffin framework and UniMM-Chat dataset. Muffin achieves state-of-the-art performance on a wide range of vision-language tasks, significantly surpassing state-of-the-art models like LLaVA and InstructBLIP. Our model and dataset are all accessible at https://github.com/thunlp/muffin.

연구 동기 및 목표

  • 추가적인 정렬 모듈이나 리샘플러가 필요로 하는 기존 MLLM 아키텍처의 비효율성과 복잡성을 해결하기 위해.
  • 현재의 멀티모달 지시 훈련 데이터셋이 깊이, 다양성, 상호보완적 정보 부족 등의 한계를 지닌다는 점을 극복하기 위해.
  • LLM의 추론 능력과 사실 기반 정확도를 향상시키기 위해 통합적이고 고품질이며 지식 집약적인 멀티모달 지시 훈련 데이터셋을 개발하기 위해.
  • 사전 훈련된 VLM을 LLM에 직접 통합함으로써 추가 정렬 훈련 없이도 뛰어난 성능을 달성할 수 있음을 입증하기 위해.
  • 동일한 이미지에 대해 여러 소스에서 온 주석을 융합하여 멀티모달 데이터셋을 구축하는 새로운 패러다임을 설정하기 위해.

제안 방법

  • Muffin은 압축된 사전 훈련된 시각-언어 모델(예: ALBEF, CoCa, BEiT-3)을 직접 사용하여 외부 브리지 모듈이나 리샘플러가 필요 없도록 한다.
  • VLM의 임bedding 공간에 학습 가능한 쿼리 벡터를 도입하여 시각적 표현을 추출하고 LLM에 주입함으로써 엔드 투 엔드 훈련을 가능하게 한다.
  • UniMM-Chat 데이터셋은 동일한 이미지에 대해 여러 시각-언어 데이터셋(예: COCO)의 주석을 융합하여 더 풍부하고 지식 집약적인 대화 데이터를 생성한다.
  • GPT-4를 활용한 유연한 프롬프팅 전략을 적용하여 융합된 주석을 다양한 고품질의 다중 대화형 대화로 변환한다.
  • 고해상도 이미지를 사전 훈련 및 지시 훈련 단계에서 활용할 수 있도록 지원하여 세밀한 시각적 세부 정보를 유지한다.
  • 복잡한 개방형 질문에 대해 모델 출력을 평가하기 위해 GPT-4를 사용하여 복잡한, 개방형 질문을 기반으로 한 새로운 벤치마크인 UniMM-Bench를 도입한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 시각-언어 모델이 추가 정렬 모듈 없이도 시각 인코더와 대규모 언어 모델 간의 효과적인 '즉시 사용 가능한' 다리로 기능할 수 있는가?
  • RQ2여러 데이터셋에서 온 상호보완적인 주석을 융합함으로써 멀티모달 지시 훈련 데이터의 품질과 지식 집약도가 어떻게 향상되는가?
  • RQ3UniMM-Chat과 같이 지식 집약적이고 다중 소스 주석이 부여된 데이터셋으로 훈련할 경우, MLLM의 추론 능력과 사실 기반 정확도는 어느 정도 향상되는가?
  • RQ4LLM에 외부 리샘플러나 프로젝터를 사용하는 복잡한 아키텍처에 비해, Muffin과 같은 단순하고 통합된 훈련 프레임워크가 더 뛰어난 성능을 낼 수 있는가?
  • RQ5이미지 해상도와 토닝 전략이 복잡한 추론 작업에서 멀티모달 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • Muffin은 여러 시각-언어 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, 시각 질문 응답, 시각 대화, 세부 묘사 작업에서 LLaVA와 InstructBLIP를 모두 능가한다.
  • UniMM-Bench 벤치마크에서 Muffin은 73.4%의 점수를 기록하여 원본 데이터셋이나 보다 포괄성이 떨어지는 변형으로 훈련된 모델들을 크게 앞서 간다.
  • UniMM-Chat으로 훈련된 모델은 LLaVA 테스트 세트에서 85.7%의 정확도를 달성하여 우수한 일반화 능력과 도메인 외 예측에 대한 강건성을 입증한다.
  • 절단 실험 결과, 융합된 주석(예: UniMM-Chat)을 사용할 경우 고립된 또는 상호보완적이지 않은 데이터(예: UniMM-Chat-sep)를 사용하는 것보다 더 뛰어난 성능을 기록함으로써 데이터 융합의 가치를 확인한다.
  • 사전 훈련 또는 지시 훈련 중에 이미지 해상도를 낮추면 성능에 심각한 하락이 발생함을 확인하여, 고해상도 시각 입력이 복잡한 작업에 있어 중요함을 시사한다.
  • 지시 훈련 중에 LLM을 고정할 경우 UniMM-Bench에서 성능이 10점 하락함을 확인하여, 최적의 지식 통합을 위해 LLM의 토닝이 필수적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.