[論文レビュー] MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
本稿では、タスク干渉を低減するために視覚および言語の専門家に特化させるMixture of Multimodal Experts (MoME)を提案する。MoMEは、クロスエンコーダー特徴の整合化に適応的可変変換を用いるMixture of Vision Experts (MoVE)と、スパースにゲートされたアダプタを用いるMixture of Language Experts (MoLE)を採用し、効率的かつ低コストの性能向上を実現する。文書指向のタスクにおいて最大20.1ポイントの精度向上を達成し、視覚および言語モダリティにおいて強力な専門性を示す。
Multimodal large language models (MLLMs) have demonstrated impressive capabilities across various vision-language tasks. However, a generalist MLLM typically underperforms compared with a specialist MLLM on most VL tasks, which can be attributed to task interference. In this paper, we propose a mixture of multimodal experts (MoME) to mitigate task interference and obtain a generalist MLLM. Our MoME is composed of two key components, a mixture of vision experts (MoVE) and a mixture of language experts (MoLE). MoVE can adaptively modulate the features transformed from various vision encoders, and has a strong compatibility in transformation architecture. MoLE incorporates sparsely gated experts into LLMs to achieve painless improvements with roughly unchanged inference costs. In response to task interference, our MoME specializes in both vision and language modality to adapt to task discrepancies. Extensive experiments show that MoME significantly improves the performance of generalist MLLMs across various VL tasks. The source code is released at https://github.com/JiuTian-VL/MoME
研究の動機と目的
- 一般化マルチモーダル大規模言語モデル(MLLM)におけるタスク干渉を軽減し、多様な視覚言語(VL)タスク全体でのパフォーマンスを向上させること。
- テキストの差異にのみ注目するのではなく、視覚および言語モダリティの両方における特化を可能にすることで、一般化MLLMのパフォーマンスを向上させること。
- 推論コストを著しく増加させることなく、マルチモーダル専門家を統合できる軽量で効率的なアーキテクチャを設計すること。
- ルーティング機構を通じて、視覚および言語空間において専門家特化が自然に発現することを示すこと。
提案手法
- 複数の視覚エンコーダ(例:CLIP-ViT, DINOv2, Pix2Struct)からの特徴を統合・強化するために、適応的可変変換(ADT)モジュールを備えたMixture of Vision Experts (MoVE)を導入する。
- 入力指示に応じて動的に選択・集約される視覚特徴を可能にするインスタンスレベルのソフトルーターをMoVEで採用し、タスク固有の視覚表現学習を実現する。
- 各フィードフォワード層にスパースにゲートされた、パrameter効率の良いアダプタを統合することで、計算オーバーヘッドを最小限に抑えたMixture of Language Experts (MoLE)を設計する。
- 各入力に対して最も関連性の高い専門家にトークンをルーティングするルーター機構をMoLEで採用し、動的かつタスクに適応した言語理解を可能にする。
- 4つのVLタスクグループをカバーする多様なインstructチューニングデータセット上で統一された訓練目的を適用し、専門家特化を促進する。
- 負荷バランスとルーティング可視化を用いて、専門家がピクセル2構造(Pix2Struct)のように、文書タスクなどの異なるタスクグループに特化していることを検証する。
実験結果
リサーチクエスチョン
- RQ1マルチモーダル専門家特化によってタスク干渉を軽減することで、一般化MLLMが専門家モデルと同等のパフォーマンスを達成できるか?
- RQ2視覚および言語の両方のモダリティに同時に特化させることで、言語のみに特化させる場合よりも、多様なVLタスク全体でより良いパフォーマンスが得られるか?
- RQ3Mixture of Multimodal Experts (MoME)は、複数のタスクグループにわたるマルチモーダル理解を著しく向上させながら、推論コストを低く維持できるか?
- RQ4MoMEの視覚および言語専門家は、明確なタスク固有のルーティングパターンを示しており、効果的な特化が実現していると見なせるか?
主な発見
- MoVEは全VLタスクで平均12.87ポイントのパフォーマンス向上を達成し、特に『文書』グループでは20.1ポイント以上の向上を示した。
- MoLEは最小限の計算コストで一貫したパフォーマンス向上を実現し、パrameter効率の良いアダプタがMoEベースのMLLMで効果的に使用可能であることを示した。
- ルーティング結果の可視化により、強い専門家特化が確認された。例えば、文書関連タスクでは『Pix2Struct』専門家が70%以上の確率で選択された。
- MoVEおよびMoLEの両コンponentが、4つのタスクグループ全体でパフォーマンスを向上させ、特に文書および視覚的推論タスクで最大の向上を示した。
- TextCaps(+130.8)、Flickr30K(94.6)、RefCOCO(83.2)といった主要ベンチマークにおいて、MoMEは最先端の一般化およびMoEベースのMLLMを上回り、優れた一般化能力を示した。
- MoVEおよびMoLEの両方のルーティング行動は、タスクに強く依存しており、類似したタスクでは類似した専門家選択パターンを示した。これにより、効果的な特化が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。