Skip to main content
QUICK REVIEW

[论文解读] MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models

Leyang Shen, Gongwei Chen|arXiv (Cornell University)|Jul 17, 2024
Topic Modeling被引用 4
一句话总结

该论文提出MoME,一种多模态专家混合模型,通过为视觉和语言专家分配专门任务以减少任务干扰,从而增强通用多模态大语言模型(MLLM)的性能。MoME采用多模态视觉专家混合(MoVE),结合自适应可变形变换模块实现跨编码器特征对齐;同时采用多模态语言专家混合(MoLE),结合稀疏门控适配器实现高效、低成本的性能提升,在文档导向任务上最高实现20.1个百分点的准确率增益,并在视觉与语言模态中均展现出强大的专家专业化能力。

ABSTRACT

Multimodal large language models (MLLMs) have demonstrated impressive capabilities across various vision-language tasks. However, a generalist MLLM typically underperforms compared with a specialist MLLM on most VL tasks, which can be attributed to task interference. In this paper, we propose a mixture of multimodal experts (MoME) to mitigate task interference and obtain a generalist MLLM. Our MoME is composed of two key components, a mixture of vision experts (MoVE) and a mixture of language experts (MoLE). MoVE can adaptively modulate the features transformed from various vision encoders, and has a strong compatibility in transformation architecture. MoLE incorporates sparsely gated experts into LLMs to achieve painless improvements with roughly unchanged inference costs. In response to task interference, our MoME specializes in both vision and language modality to adapt to task discrepancies. Extensive experiments show that MoME significantly improves the performance of generalist MLLMs across various VL tasks. The source code is released at https://github.com/JiuTian-VL/MoME

研究动机与目标

  • 为解决通用多模态大语言模型(MLLM)中的任务干扰问题,该问题会阻碍其在多样化视觉-语言(VL)任务上的性能表现。
  • 通过在视觉和语言模态中实现专业化,而非仅关注文本差异,从而提升通用MLLM的性能。
  • 设计一种轻量化、高效的架构,在不显著增加推理成本的前提下集成多模态专家。
  • 证明通过路由机制,视觉与语言空间中的专家专业化能够自然涌现。

提出的方法

  • 提出多模态视觉专家混合(MoVE),利用自适应可变形变换(ADT)模块统一并增强来自多个视觉编码器(如CLIP-ViT、DINOv2、Pix2Struct)的特征。
  • 在MoVE中采用实例级软路由机制,根据输入指令动态选择并聚合视觉特征,实现基于任务的视觉表征学习。
  • 设计多模态语言专家混合(MoLE),将稀疏门控、参数高效的适配器集成到LLM的每个前馈层中,最大限度降低计算开销。
  • 在MoLE中使用路由机制,将token动态路由至最相关的专家,实现动态、任务感知的语言理解。
  • 在涵盖四个VL任务组的多样化指令微调数据集上应用统一的训练目标,以促进专家专业化。
  • 通过负载均衡与路由可视化验证,专家在不同任务组中实现专业化,例如Pix2Struct专家在文档任务中被选中超过70%的时间。

实验结果

研究问题

  • RQ1通过多模态专家专业化减轻任务干扰,通用MLLM能否实现与专用模型相当的性能?
  • RQ2在视觉与语言模态中实现联合专业化,是否能比仅在语言模态中专业化带来更优的多样化VL任务性能?
  • RQ3多模态专家混合(MoME)能否在显著提升多模态理解能力的同时,保持较低的推理成本?
  • RQ4MoME中的视觉与语言专家是否表现出清晰、任务特定的路由模式,表明其具备有效的专业化能力?

主要发现

  • MoVE在所有VL任务上平均提升12.87分,其中在‘Document’任务组中提升超过20.1分。
  • MoLE在计算成本极低的前提下实现了稳定的性能增益,证明参数高效的适配器可在MoE架构的MLLM中有效应用。
  • 路由结果可视化显示专家专业化程度高:例如,对于文档相关任务,'Pix2Struct'专家被选中的比例超过70%。
  • MoVE与MoLE组件协同提升了所有四个任务组的性能,其中在文档和视觉推理任务中增益最为显著。
  • MoME在关键基准测试中优于当前最先进的一般化模型与MoE架构MLLM,如TextCaps(+130.8)、Flickr30K(+94.6)和RefCOCO(+83.2),展现出卓越的泛化能力。
  • MoVE与MoLE的路由行为高度依赖任务,相似任务表现出相似的专家选择模式,证实了有效专业化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。