Skip to main content
QUICK REVIEW

[논문 리뷰] Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning

Yunhao Gou, Zhili Liu|arXiv (Cornell University)|2023. 12. 19.
Robotics and Automated Systems인용 수 4
한 줄 요약

이 논문은 지시어 클러스터링을 통해 입력을 작업별로 특화된 LoRA 전문가에게 라우팅하면서 일반화 능력을 유지하는 Mixture of Cluster-conditional LoRA Experts 아키텍처인 MoCLE을 제안한다. 지시어 클러스터에 기반해 동적으로 전문화된 파라미터를 활성화함으로써 비전-언어 지시어 튜닝에서의 작업 간 갈등을 완화하고, 12개의 후행 작업에서 최신 기술 수준의 zero-shot 성능을 달성하며 전문화성과 일반화 능력을 향상시킨다.

ABSTRACT

Instruction tuning of Large Vision-language Models (LVLMs) has revolutionized the development of versatile models with zero-shot generalization across a wide range of downstream vision-language tasks. However, the diversity of training tasks of different sources and formats would lead to inevitable task conflicts, where different tasks conflict for the same set of model parameters, resulting in sub-optimal instruction-following abilities. To address that, we propose the Mixture of Cluster-conditional LoRA Experts (MoCLE), a novel Mixture of Experts (MoE) architecture designed to activate the task-customized model parameters based on the instruction clusters. A separate universal expert is further incorporated to improve generalization capabilities of MoCLE for novel instructions. Extensive experiments on InstructBLIP and LLaVA demonstrate the effectiveness of MoCLE.

연구 동기 및 목표

  • 다양하고 상충되는 작업들이 포함된 다중 작업 학습에서 발생하는 음성 전이와 작업 간 갈등을 해결하기 위해 비전-언어 지시어 튜닝에서 발생하는 문제를 해결한다.
  • 수동적인 작업 분류 체계를 대체할 수 있는 자동적이고 확장 가능한 학습 데이터 분할 전략을 개발한다.
  • 작업별 전문가와 유니버설 전문가를 조합하여 비전-언어 모델의 전문화성과 일반화 능력의 균형을 맞춘다.
  • 지시어 의미에 기반한 라우팅과 더불어 파라미터 효율성을 향상시켜 새로운 작업에 대해 효과적인 zero-shot 일반화를 가능하게 한다.

제안 방법

  • 사전 학습된 Sentence Transformer (all-MiniLM-L6-v2)와 k-means를 사용해 다양한 비전-언어 데이터셋의 지시어를 클러스터링하여 64개의 지시어 클러스터를 형성한다.
  • 각 전문가가 지시어 클러스터에 조건부로 설정된 LoRA 어댑터인 Mixture of Experts (MoE) 아키텍처를 학습한다. 이는 작업별로 특화된 파라미터 업데이트를 가능하게 한다.
  • 모든 클러스터에 공통으로 사용되는 유니버설 LoRA 전문가를 통합하여, 새로운 지시어나 희귀 지시어에 대해서도 일반화 능력을 유지한다.
  • 각 트랜스포머 레이어에 라우터 모듈을 도입하여 지시어 임베딩에 기반해 입력 토큰을 가장 관련성이 높은 클러스터 조건부 전문가와 유니버설 전문가로 동적으로 라우팅한다.
  • LoRA를 사용하여 InstructBLIP 모델을 MoCLE로 미세조정함으로써, 동결된 LLM을 유지하면서도 시각적 인코더와 어댑터 파라미터를 효율적으로 적응시킨다.
  • 보류된 zero-shot 작업에서 라우팅 결정과 모델 성능을 평가하여, 작업별 라우팅과 일반화 능력의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1다중 작업 비전-언어 지시어 튜닝 중 발생하는 작업 간 갈등이 보류된 zero-shot 후행 작업의 성능을 떨어뜨리는가?
  • RQ2지시어 기반 클러스터링이 수동적인 작업 분류 체계를 대체할 수 있는 효과적이고 자동적이고 확장 가능한 학습 데이터 분할 전략이 될 수 있는가?
  • RQ3클러스터 조건부 전문가와 유니버설 전문가를 포함한 MoE 아키텍처가 동시에 작업 전문화성과 일반화 능력을 달성할 수 있는가?
  • RQ4다양한 비전-언어 작업에서 MoCLE가 표준 지시어 튜닝 및 다른 MoE 베이스라인 대비 zero-shot 성능에서 어떻게 비교되는가?

주요 결과

  • MoCLE는 8개의 보류된 zero-shot 작업 중 5개에서 표준 지시어 튜닝을 능가하여 음성 전이 완화를 입증한다.
  • 이미지 캡션 생성 작업(Flickr30K)에서 MoCLE는 표준 지시어 튜닝 대비 2.1 BLEU-4 향상률을 기록한다.
  • 지식 기반 VQA 작업(ScienceQA)에서 MoCLE는 전체 미세조정 베이스라인 대비 4.3%p의 정확도 절대 향상률을 기록한다.
  • 라우팅 분석 결과 MoCLE는 작업 수준의 라우팅을 가능하게 한다: VQA 작업은 주로 전문가 0으로 라우팅되고, 캡션 작업은 전문가 3으로 라우팅되며, 이는 효과적인 전문화성을 시사한다.
  • 반면, Sentence-MoLE는 작업과 전문가 간에 명확한 상관관계를 보이지 않아, 라우팅이 비효율적이고 여전히 작업 간 갈등이 지속됨을 시사한다.
  • 유니버설 전문가의 존재는 필수적이다. 이 전문가가 없을 경우, 새로운 지시어나 다중 작업 영향을 받는 지시어에서 성능이 크게 저하된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.