Skip to main content
QUICK REVIEW

[논문 리뷰] Foundation Model is Efficient Multimodal Multitask Model Selector

Fanqing Meng, Wenqi Shao|arXiv (Cornell University)|2023. 08. 11.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 다양한 레이블 형식(예: 카테고리, 텍스트, 경계 박스)을 통합된 노이즈 있는 레이블 임베딩으로 변환하는 데 기초 모델을 사용하는 효율적인 다중 작업 모델 선택기인 EMMS를 제안한다. 이를 통해 다중 모odal 작업 간에 가속되고 정확한 이식 가능성 추정이 가능해지며, 가중 선형 회귀를 통한 추정이 가능해진다. EMMS는 LogME 대비 최대 54.8% 높은 순위 정확도와 6.29배 빠른 추론 속도를 기록하며, 작업별 사전 지식 없이도 다중 모달, 다중 작업 환경에서 일반화하는 데 있어 최초의 방법이다.

ABSTRACT

This paper investigates an under-explored but important problem: given a collection of pre-trained neural networks, predicting their performance on each multi-modal task without fine-tuning them, such as image recognition, referring, captioning, visual question answering, and text question answering. A brute-force approach is to finetune all models on all target datasets, bringing high computational costs. Although recent-advanced approaches employed lightweight metrics to measure models' transferability,they often depend heavily on the prior knowledge of a single task, making them inapplicable in a multi-modal multi-task scenario. To tackle this issue, we propose an efficient multi-task model selector (EMMS), which employs large-scale foundation models to transform diverse label formats such as categories, texts, and bounding boxes of different downstream tasks into a unified noisy label embedding. EMMS can estimate a model's transferability through a simple weighted linear regression, which can be efficiently solved by an alternating minimization algorithm with a convergence guarantee. Extensive experiments on 5 downstream tasks with 24 datasets show that EMMS is fast, effective, and generic enough to assess the transferability of pre-trained models, making it the first model selection method in the multi-task scenario. For instance, compared with the state-of-the-art method LogME enhanced by our label embeddings, EMMS achieves 9.0\%, 26.3\%, 20.1\%, 54.8\%, 12.2\% performance gain on image recognition, referring, captioning, visual question answering, and text question answering, while bringing 5.13x, 6.29x, 3.59x, 6.19x, and 5.66x speedup in wall-clock time, respectively. The code is available at https://github.com/OpenGVLab/Multitask-Model-Selector.

연구 동기 및 목표

  • 피팅 없이도 여러 다중 모달 작업에 대해 최적의 사전 학습된 모델을 효율적으로 선택하는 문제를 해결하기 위해.
  • 기존 이식 가능성 측정 지표가 작업별 사전 지식에 의존하고 다중 모달, 다중 작업 환경에서는 실패하는 한계를 극복하기 위해.
  • 이질적인 레이블 형식을 가진 다양한 후행 작업 간의 모델 이식 가능성 평가를 위한 일반적이고 빠르고 정확한 방법을 개발하기 위해.
  • 기초 모델을 활용해 레이블을 통합된 임베딩 공간으로 변환함으로써 효율적인 모델 선택을 가능하게 하기 위해.

제안 방법

  • EMMS는 대규모 기초 모델(예: CLIP, GPT-2)을 활용해 다양한 후행 작업 레이블(예: 카테고리, 텍스트 기술, 경계 박스 등)을 공통된 통합 임베딩 공간으로 매핑한다.
  • 해당 임베딩을 노이즈 있는 오라클로 간주하고, 이식 가능성 추정 문제를 가중 선형 제곱 회귀(Weighted Least Squares Regression, WLSR) 문제로 재구성한다.
  • 이론적 수렴 보장을 갖춘 교대 최적화 알고리즘을 통해 WLSR 문제를 해결함으로써 효율적인 최적화를 가능하게 한다.
  • 이 방법은 일반성과 확장성을 고려해 설계되었으며, 작업별 아키텍처 수정 없이 다양한 레이블 형식을 처리할 수 있다.
  • 기초 모델의 풍부한 의미 표현 능력을 활용해 one-hot 또는 실수형 인코딩을 초월한 복잡한 레이블 의미를 포착한다.
  • 프레임워크는 엔드 투 엔드 미분 가능하며 배치 처리를 지원하여 여러 모델과 작업 간에 빠른 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다양한 레이블 형식(예: 텍스트, 카테고리, 경계 박스)의 통합 표현 방식이 다중 모달 작업 간 이식 가능성 추정에 어떻게 기여하는가?
  • RQ2LogME 및 TransRate와 같은 기존 측정 지표와 비교해 EMMS는 다양한 후행 작업에서 정확도와 효율성 측면에서 어떻게 성능을 내는가?
  • RQ3기초 모델에서 유도된 레이블 임베딩을 사용할 경우, 기존 레이블 인코딩 방법 대비 모델 선택 성능 향상 정도는 어느 정도인가?
  • RQ4제안된 WLSR에 대한 교대 최적화 알고리즘이 수렴 보장이 있으며 실질적으로 효율적인가?
  • RQ5EMMS는 작업별 적응 없이도 다양한 다중 모달 작업에 효과적으로 일반화될 수 있는가?

주요 결과

  • EMMS는 이미지 인식, 참조, 캡션 생성, 시각적 질의 응답, 텍스트 질의 응답 작업에서 각각 LogME 대비 9.0%, 26.3%, 20.1%, 54.8%, 12.2% 성능 향상을 기록했다.
  • 동일한 작업들에서 EMMS는 추론 시간을 5.13배, 6.29배, 3.59배, 6.19배, 5.66배로 단축시켜 빠른 성능 향상을 입증했다.
  • Sun397 데이터셋에서 EMMS는 수렴하지 않은 T=1 상태의 LogME보다 가중 켄달 타우에서 0.082 높은 성능를 기록했으며, 이는 더 높은 계산 복잡도임에도 불구하고 성능 향상을 보였다.
  • EMMS는 K=1 및 K=3 F-레이블 모두에서 TransRate를 일관되게 능가했으며, 이미지 분류 작업에서 평균 가중 켄달 타우가 0.082 높았다.
  • 교대 최적화 알고리즘이 신뢰성 있고 효율적으로 수렴하여, 24개의 데이터셋과 5개의 후행 작업에서 빠른 모델 선택을 가능하게 했다.
  • EMMS는 작업별 사전 지식 없이도 다중 모달, 다중 작업 환경에서 효과적이고 일반적이며 효율적인 모델 선택을 가능하게 하는 최초의 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.