Skip to main content
QUICK REVIEW

[논문 리뷰] MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting

Oscar Mañas, Pau Rodríguez|arXiv (Cornell University)|2022. 10. 13.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

MAPL은 냉각된 단모달 시각 및 언어 모델을 위한 파rameter 효율적인 방법으로, 표현 공간 간의 경량 매핑을 학습하여 시각-언어 적응형 소수 예제 프롬프팅을 가능하게 한다. 기존 방법보다 수천 배에서 수만 배 이상 적은 파rameter를 학습하면서도 VQA 및 이미지 캡션 생성 벤치마크에서 경쟁적인 성능을 달성한다. 특히 저자료 및 도메인 내 설정에서도 효과적이다.

ABSTRACT

Large pre-trained models have proved to be remarkable zero- and (prompt-based) few-shot learners in unimodal vision and language tasks. We propose MAPL, a simple and parameter-efficient method that reuses frozen pre-trained unimodal models and leverages their strong generalization capabilities in multimodal vision-language (VL) settings. MAPL learns a lightweight mapping between the representation spaces of unimodal models using aligned image-text data, and can generalize to unseen VL tasks from just a few in-context examples. The small number of trainable parameters makes MAPL effective at low-data and in-domain learning. Moreover, MAPL's modularity enables easy extension to other pre-trained models. Extensive experiments on several visual question answering and image captioning benchmarks show that MAPL achieves superior or competitive performance compared to similar methods while training orders of magnitude fewer parameters. MAPL can be trained in just a few hours using modest computational resources and public datasets. We release our code and pre-trained model weights at https://github.com/mair-lab/mapl.

연구 동기 및 목표

  • 소수의 컨텍스트 예시만을 사용하여 시각-언어 작업에서 소수 예제 일반화를 가능하게 하기 위해.
  • 기존의 대규모 사전 학습 모델에 대해 미세조정 또는 어댑터 레이어를 적용하는 방법과 비교해 학습 가능한 파rameter 수를 줄이기 위해.
  • 냉각된 단모달 기초 모델을 재사용하여 효과적인 저자료 및 도메인 내 학습을 가능하게 하기 위해.
  • 새로운 또는 향상된 사전 학습 모델에 쉽게 적용할 수 있는 모듈러하고 확장 가능한 프레임워크를 제공하기 위해.
  • 파rameter 효율성이 최종 시각-언어 벤치마크 성능에 악영향을 주지 않음을 입증하기 위해.

제안 방법

  • MAPL은 미세조정이나 어댑터 레이어 없이 냉각된 사전 학습된 시각 인코더(예: CLIP)와 순차적 언어 모델(예: GPT)을 재사용한다.
  • 쌍체의 이미지-텍스트 데이터를 사용하여 냉각된 시각 및 언어 인코더의 표현 공간을 정렬하는 경량의 학습 가능한 매핑 헤드를 도입한다.
  • 이 매핑은 이미지-캡션 쌍에서 종단 간(end-to-end)으로 학습되며, 컨텍스트 기반 학습을 통해 새로운 시각-언어 작업으로 일반화할 수 있도록 한다.
  • 이 방법은 모듈러하며, 어떤 사전 학습된 단모달 모델에도 적용 가능하므로 더 나은 또는 새로운 모델로의 확장이 용이하다.
  • 학습은 보편적인 데이터셋을 사용하고, 적은 계산 자원으로 수행되며, 몇 시간 내에 완료된다.
  • 냉각된 언어 모델의 컨텍스트 기반 학습 능력을 활용하여 소수의 소수 예제에서 일반화할 수 있다.

실험 결과

연구 질문

  • RQ1냉각된 단모달 모델 간의 경량 매핑이 시각-언어 작업에서 강력한 소수 예제 성능을 달성할 수 있는가?
  • RQ2대규모 다모달 데이터에서 미세조정 또는 어댑터 레이어를 사용하는 방법과 비교해 MAPL은 어떤 성능을 보이는가?
  • RQ3낮은 자료 및 도메인 내 학습 설정에서, 최소한의 파rameter 업데이트로 효과적으로 일반화할 수 있는가?
  • RQ4MAPL의 파라미터 효율성으로 인해 성능이 저하되는가, 아니면 더 복잡한 방법에 비해 동등하거나 이를 초월할 수 있는가?
  • RQ5MAPL의 성능는 무작위 가중치 초기화에 얼마나 민감한가, 그리고 분산을 줄일 수 있는가?

주요 결과

  • MAPL은 파라미터 학습 수가 기존 방법들(예: Frozen, Eichenberg et al. (2021), Dai et al. (2022))보다 수천 배에서 수만 배 이상 적음에도 불구하고, 여러 이미지 캡션 및 VQA 벤치마크에서 우수하거나 경쟁적인 성능을 달성한다.
  • 저자료 학습(다모달 데이터의 1%) 설정에서 MAPL은 Frozen을 크게 능가하며, 뛰어난 파라미터 효율성을 입증한다.
  • 도메인 내 학습 설정에서, 사전 학습 없이 100% 또는 1%의 작업 특화 데이터로 직접 학습한 MAPL은 동일 조건에서 Frozen을 능가한다.
  • MAPL은 보편적인 데이터셋과 보통의 계산 자원을 사용해 몇 시간 내에 학습이 가능하므로, 작은 연구소나 독립 연구자들에게도 접근 가능하다.
  • 다양한 무작위 시드에 따라 성능 변동이 다소 존재하며, 이는 학습 가능한 파rameter 수가 적기 때문일 수 있으나, 시드 간 평균 성능는 안정적이다.
  • MAPL은 컨텍스트 기반 학습에서 더 많은 예제를 활용하는 데 어려움을 겪는다. 이는 단일 이미지-캡션 쌍이 아닌 다중 예제 순서로 학습된 것이 아니라서일 수 있으며, 더 나은 사전 학습 과제가 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.