Skip to main content
QUICK REVIEW

[논문 리뷰] MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models

Leyang Shen, Gongwei Chen|arXiv (Cornell University)|2024. 07. 17.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 작업 간 간섭을 줄이기 위해 시각 및 언어 전문가를 특화시켜 일반화된 다중모odal 대규모 언어 모델(MLLM)의 성능을 햖थन하는 MoME(Mixture of Multimodal Experts)를 제안한다. MoME는 교차 인코더 특징 정렬을 위한 적응형 탄성 변환을 사용하는 다중 시각 전문가(MoVE)와 효율적이고 저비용 성능 향상을 위한 희소하게 게이트된 어댑터를 갖춘 다중 언어 전문가(MoLE)를 포함한다. 이는 문서 기반 작업에서 최대 20.1점의 정확도 향상을 기록했으며, 시각 및 언어 모odal에서 강력한 전문가 특화를 달성한다.

ABSTRACT

Multimodal large language models (MLLMs) have demonstrated impressive capabilities across various vision-language tasks. However, a generalist MLLM typically underperforms compared with a specialist MLLM on most VL tasks, which can be attributed to task interference. In this paper, we propose a mixture of multimodal experts (MoME) to mitigate task interference and obtain a generalist MLLM. Our MoME is composed of two key components, a mixture of vision experts (MoVE) and a mixture of language experts (MoLE). MoVE can adaptively modulate the features transformed from various vision encoders, and has a strong compatibility in transformation architecture. MoLE incorporates sparsely gated experts into LLMs to achieve painless improvements with roughly unchanged inference costs. In response to task interference, our MoME specializes in both vision and language modality to adapt to task discrepancies. Extensive experiments show that MoME significantly improves the performance of generalist MLLMs across various VL tasks. The source code is released at https://github.com/JiuTian-VL/MoME

연구 동기 및 목표

  • 일반화된 다중모달 대규모 언어 모델(MLLM)에서 발생하는 작업 간 간섭 문제를 해결함으로써 다양한 시각-언어(VL) 작업에서의 성능 향상을 도모한다.
  • 텍스트적 차이에만 집중하는 것이 아니라, 시각 및 언어 모달에서의 특화를 가능하게 하여 일반화된 MLLM의 성능을 향상시킨다.
  • 추론 비용을 크게 증가시키지 않으면서도 다중모달 전문가를 통합할 수 있는 경량이고 효율적인 아키텍처를 설계한다.
  • 라우팅 메커니즘을 통해 시각 및 언어 공간에서 전문가 특화가 자연스럽게 발생하는지 확인한다.

제안 방법

  • 다양한 시각 인코더(예: CLIP-ViT, DINOv2, Pix2Struct)의 특징을 통합하고 향상시키기 위해 적응형 탄성 변환(ADT) 모듈을 사용하는 다중 시각 전문가(MoVE)를 도입한다.
  • 입력 지시문에 따라 동적으로 선택 및 집계되는 시각 특징을 가능하게 하기 위해 MoVE에서 인스턴스 수준의 소프트 라우터를 활용한다. 이는 작업 기반의 시각적 표현 학습을 가능하게 한다.
  • 모든 피드포워드 레이어에 희소하게 게이트된, 파rameter 효율적인 어댑터를 통합하여 계산 오버헤드를 최소화하는 다중 언어 전문가(MoLE)를 설계한다.
  • 입력에 따라 토큰을 가장 관련성이 높은 전문가에게 라우팅하는 라우터 메커니즘을 사용하여 동적이고 작업 인식 기반의 언어 이해를 가능하게 한다.
  • 다양한 지시 튜닝 데이터셋을 활용하여 네 가지 VL 작업 그룹을 포함하는 통합 학습 목표를 적용하여 전문가 특화를 장려한다.
  • 로드 밸런싱 및 라우팅 시각화를 통해 전문가가 서로 다른 작업 그룹에 특화되어 있음을 검증한다. 예를 들어, 문서 작업에 대해 Pix2Struct 전문가의 선택 비율이 70% 이상이다.

실험 결과

연구 질문

  • RQ1다중모달 전문가 특화를 통해 작업 간 간섭을 완화함으로써 일반화된 MLLM이 전문가 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2시각 및 언어 모달에서의 공동 특화가 언어 모달 전용 특화보다 다양한 VL 작업에서 더 나은 성능을 내는가?
  • RQ3다중모달 전문가(MoME)가 다수의 작업 그룹에 걸쳐 다중모달 이해 능력을 크게 향상시키면서도 추론 비용을 낮게 유지할 수 있는가?
  • RQ4MoME의 시각 및 언어 전문가가 명확한 작업 기반 라우팅 패턴을 보이며 효과적인 특화가 이루어지고 있는가?

주요 결과

  • MoVE는 모든 VL 작업에서 평균 12.87점의 성능 향상을 기록했으며, '문서' 그룹에서는 20.1점 이상의 향상을 기록했다.
  • MoLE는 최소한의 계산 오버헤드로 일관된 성능 향상을 제공하여, 파rameter 효율적인 어댑터가 MoE 기반 MLLM에서 효과적으로 활용될 수 있음을 입증했다.
  • 라우팅 결과의 시각화 결과는 강력한 전문가 특화가 이루어져 있음을 보여주며, 예를 들어 문서 관련 작업에서는 'Pix2Struct' 전문가가 70% 이상의 비율로 선택된다.
  • MoVE와 MoLE 구성 요소가 함께 작용하여 네 가지 작업 그룹 전반에서 성능 향상을 이끌었으며, 특히 문서 및 시각적 추론 작업에서 가장 높은 성능 향상을 기록했다.
  • MoME는 TextCaps(+130.8), Flickr30K(94.6), RefCOCO(83.2) 등의 주요 벤치마크에서 최신 기술의 일반화된 MLLM 및 MoE 기반 MLLM을 초월하여 뛰어난 일반화 능력을 입증했다.
  • MoVE 및 MoLE의 라우팅 행동은 매우 작업 의존적이며, 유사한 작업에서는 유사한 전문가 선택 패턴을 보이며 효과적인 특화가 이루어지고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.