Skip to main content
QUICK REVIEW

[论文解读] Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning

Yunhao Gou, Zhili Liu|arXiv (Cornell University)|Dec 19, 2023
Robotics and Automated Systems被引用 4
一句话总结

该论文提出MoCLE,一种基于聚类条件LoRA专家的混合专家架构,通过指令聚类将输入路由至特定任务的LoRA专家,同时保留一个通用专家以维持泛化能力。通过根据指令聚类动态激活专用参数,MoCLE缓解了视觉-语言指令微调中的任务冲突,在12项下游任务上实现了最先进的零样本性能,同时提升了专业化与泛化能力。

ABSTRACT

Instruction tuning of Large Vision-language Models (LVLMs) has revolutionized the development of versatile models with zero-shot generalization across a wide range of downstream vision-language tasks. However, the diversity of training tasks of different sources and formats would lead to inevitable task conflicts, where different tasks conflict for the same set of model parameters, resulting in sub-optimal instruction-following abilities. To address that, we propose the Mixture of Cluster-conditional LoRA Experts (MoCLE), a novel Mixture of Experts (MoE) architecture designed to activate the task-customized model parameters based on the instruction clusters. A separate universal expert is further incorporated to improve generalization capabilities of MoCLE for novel instructions. Extensive experiments on InstructBLIP and LLaVA demonstrate the effectiveness of MoCLE.

研究动机与目标

  • 解决多任务训练中因多样化且相互冲突的任务导致的视觉-语言指令微调中的负迁移与任务冲突问题。
  • 开发一种自动且可扩展的训练数据划分策略,以基于指令聚类替代人工任务分类体系。
  • 通过结合任务特定专家与通用专家,在视觉-语言模型中平衡专业化与泛化能力。
  • 通过基于指令语义的路由与参数效率提升,实现在未见任务上的有效零样本泛化。

提出的方法

  • 使用预训练的Sentence Transformer(all-MiniLM-L6-v2)与k-means聚类算法,对来自多样化视觉-语言数据集的指令进行聚类,形成64个指令聚类。
  • 训练一种混合专家(MoE)架构,其中每个专家均为基于指令聚类条件化的LoRA适配器,实现任务特定的参数更新。
  • 集成一个在所有聚类间共享的通用LoRA专家,以维持对新指令或罕见指令的泛化能力。
  • 在每个Transformer层使用路由模块,根据指令嵌入动态将输入token路由至最相关的聚类条件专家与通用专家。
  • 使用LoRA对InstructBLIP模型进行MoCLE微调,保持冻结的LLM,同时高效适配视觉编码器与适配器参数。
  • 在保留的零样本任务上评估路由决策与模型性能,以验证任务特定路由与泛化能力。

实验结果

研究问题

  • RQ1在多任务视觉-语言指令微调中,任务冲突是否会导致在零样本下游任务上的性能下降?
  • RQ2指令聚类能否作为人工任务分类体系的替代方案,实现自动、可扩展的训练数据划分?
  • RQ3具有聚类条件专家与通用专家的MoE架构,能否同时实现任务专业化与泛化?
  • RQ4在多样化视觉-语言任务上,MoCLE相较于标准指令微调与其他MoE基线模型,在零样本性能方面表现如何?

主要发现

  • 在8个保留的零样本任务中,MoCLE在5个任务上优于标准指令微调,表明其有效缓解了负迁移。
  • 在图像字幕生成任务(Flickr30K)上,MoCLE相比标准指令微调实现了2.1的BLEU-4提升。
  • 在基于知识的VQA任务(ScienceQA)上,MoCLE相比全微调基线实现了4.3%的绝对准确率提升。
  • 路由分析表明,MoCLE实现了任务级路由:VQA任务主要被路由至专家0,而字幕生成任务则被路由至专家3,表明其具备有效专业化能力。
  • 相比之下,Sentence-MoLE在任务与专家之间无明显相关性,表明其路由无效且任务冲突持续存在。
  • 通用专家的引入至关重要——若无该专家,模型在新指令或受多任务影响的指令上性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。