Skip to main content
QUICK REVIEW

[논문 리뷰] MAGMA -- Multimodal Augmentation of Generative Models through Adapter-based Finetuning

Constantin Eichenberg, Sidney Black|arXiv (Cornell University)|2021. 12. 09.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

MAGMA는 어댑터 기반 미세조정을 사용하여 동결된 생성형 언어 모델에 시각 능력을 추가하는 파라미터 효율적인 방법을 소개한다. 이는 임의의 시각적 및 텍스트 입력에서 종단 간 다중모odal 생성을 가능하게 한다. MAGMA는 SimVLM가 사용한 데이터의 약 ~0.2%만으로도 OKVQA에서 최고 성능을 기록하고, 다른 벤치마크에서도 경쟁력 있는 결과를 내며 최신 기술 수준을 달성한다.

ABSTRACT

Large-scale pretraining is fast becoming the norm in Vision-Language (VL) modeling. However, prevailing VL approaches are limited by the requirement for labeled data and the use of complex multi-step pretraining objectives. We present MAGMA - a simple method for augmenting generative language models with additional modalities using adapter-based finetuning. Building on Frozen, we train a series of VL models that autoregressively generate text from arbitrary combinations of visual and textual input. The pretraining is entirely end-to-end using a single language modeling objective, simplifying optimization compared to previous approaches. Importantly, the language model weights remain unchanged during training, allowing for transfer of encyclopedic knowledge and in-context learning abilities from language pretraining. MAGMA outperforms Frozen on open-ended generative tasks, achieving state of the art results on the OKVQA benchmark and competitive results on a range of other popular VL benchmarks, while pretraining on 0.2% of the number of samples used to train SimVLM.

연구 동기 및 목표

  • 언어 모델 가중치를 재학습하지 않고도 동결된 순차적 언어 모델에 시각 능력을 효과적으로 통합할 수 있는 파라미터 효율적인 방법을 개발하는 것.
  • 단일 통합 언어 모델링 목표를 통해 개방형 생성형 다중모달 작업을 가능하게 하는 것.
  • 어댑터 레이어와 정교하게 선별된 사전학습 데이터셋을 도입하여 Frozen 방법을 개선함으로써 성능을 향상시키면서도 모델 지식과 문맥 학습 능력을 유지하는 것.
  • 작은 비율의 고품질 데이터로도 대규모 노이즈가 많은 데이터셋보다 우수한 성능을 내는지 확인하는 것.
  • 다양한 최종 응용 분야의 시각-언어 작업에서 다양한 시각 인코더와 어댑터 구성이 어떻게 영향을 미치는지 탐구하는 것.

제안 방법

  • MAGMA는 GPT-J와 같은 동결된 순차적 언어 모델을 핵심 디코더로 사용하며, CLIP 기반의 ResNet 시각 인코더를 시각 기반 백본으로 활용한다.
  • 어댑터 레이어를 언어 모델의 어텐션 및 피드포워드 하위층에 삽입하여, 주 언어 모델 가중치는 동결된 채로 어댑터만 미세조정한다.
  • CLIP 인코더에서 유도된 시각 프리픽스를 입력 토큰에 연결하여 언어 모델이 이미지 특징에 기반해 조건화되도록 한다.
  • 사전학습은 약 2,500만 개의 이미지-텍스트 쌍으로 구성된 정교하게 선별된 데이터셋에서 표준 다음 토큰 예측 목표를 사용하여 수행된다. 이 데이터셋에는 최종 응용 분야의 데이터도 포함되어 있다.
  • 특정 작업용 헤드 미세조정 없이도 다중모달 작업에 대해 제로샷 및 피셔샷 추론을 가능하게 한다.
  • 모델 성능은 VQA, OKVQA, NoCaps와 같은 벤치마크에서 제로샷 추론을 통해 평가되며, 단일 작업 성능 향상을 위해 학습 분할 데이터에 추가로 미세조정이 수행된다.

실험 결과

연구 질문

  • RQ1어댑터 기반 미세조정이 동결된 언어 모델에 시각 능력을 효과적으로 통합하면서도 사전학습된 지식을 유지할 수 있는가?
  • RQ2고품질의 이미지-텍스트 쌍으로 구성된 작은 사전학습 데이터셋을 사용하면 대규모 노이즈가 많은 데이터셋보다 다중모달 사전학습에서 더 나은 성능을 내는가?
  • RQ3다양한 시각 인코더(예: CLIP-RN50x16 대비 기타)와 어댑터 구성이 다양한 시각-언어 작업에서 최종 성능에 어떻게 영향을 미치는가?
  • RQ4명시적 지도 학습 없이도 동결된 언어 모델이 복잡한 추론 및 OCR 작업을 얼마나 잘 수행할 수 있는가?
  • RQ5요소적 지각 추론 프롬프팅을 통해 다단계 추론 작업으로 일반화할 수 있는가?

주요 결과

  • MAGMA는 OKVQA 벤치마크에서 최고 성능을 기록하며, Frozen 및 SimVLM와 경쟁하는 최신 기술 수준의 정확도를 달성한다.
  • NoCaps 및 기타 벤치마크에서도 경쟁력 있는 결과를 내며, SimVLM의 사전학습 데이터의 약 ~0.2%만을 사용했음에도 불구하고 Frozen 기반 베이스라인을 뛰어넘는 성능을 보인다.
  • 아블레이션 연구에서 CLIP-RN50x16 시각 인코더가 다른 시각 백본보다 뚜렷이 뛰어나며, 특히 개방형 추론 작업에서 두각을 나타낸다.
  • 어댑터 미세조정 모델은 항상 시각 프리픽스 전용 방법보다 우수한 성능을 보이며, 언어 모델 내부 표현에 파라미터 효율적 적응이 중요한 역할을 한다는 것을 입증한다.
  • 사전학습 데이터셋에 최종 응용 분야의 데이터를 포함시켰을 때 성능 향상이 두드러지게 나타나며, 특히 VQA 및 이미지 캡션 생성 작업에서 두드러진다.
  • MAGMA는 CLIP를 속이는 악성 타이포 공격에 강건하며, 지도 학습 없이도 강력한 피셔샷 OCR 및 텍스트 복원 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.