[논문 리뷰] MaPLe: Multi-modal Prompt Learning
MaPLe는 복수의 시각 및 언어 브랜치를 함께 미세조정하기 위해 결합된 깊이 있는 문맥 프롬프트를 사용하는 다중모달 프롬프트 학습을 제안하며, 새로운 클래스, 교차 데이터셋 전이, 도메인 이동에 걸쳐 뛰어난 일반화 성능을 달성한다. 이는 11개의 이미지 인식 데이터셋에서 신규 클래스에 대해 SOTA 성능을 3.45% 향상시키고 조화 평균에서 2.72% 향상시키며, 최소한의 파라미터 및 FLOP 오 overhead 를 유지하면서도 효율성을 확보한다.
Pre-trained vision-language (V-L) models such as CLIP have shown excellent generalization ability to downstream tasks. However, they are sensitive to the choice of input text prompts and require careful selection of prompt templates to perform well. Inspired by the Natural Language Processing (NLP) literature, recent CLIP adaptation approaches learn prompts as the textual inputs to fine-tune CLIP for downstream tasks. We note that using prompting to adapt representations in a single branch of CLIP (language or vision) is sub-optimal since it does not allow the flexibility to dynamically adjust both representation spaces on a downstream task. In this work, we propose Multi-modal Prompt Learning (MaPLe) for both vision and language branches to improve alignment between the vision and language representations. Our design promotes strong coupling between the vision-language prompts to ensure mutual synergy and discourages learning independent uni-modal solutions. Further, we learn separate prompts across different early stages to progressively model the stage-wise feature relationships to allow rich context learning. We evaluate the effectiveness of our approach on three representative tasks of generalization to novel classes, new target datasets and unseen domain shifts. Compared with the state-of-the-art method Co-CoOp, MaPLe exhibits favorable performance and achieves an absolute gain of 3.45% on novel classes and 2.72% on overall harmonic-mean, averaged over 11 diverse image recognition datasets. Our code and pre-trained models are available at https://github.com/muzairkhattak/multimodal-prompt-learning.
연구 동기 및 목표
- CLIP에서 단일 모odal 프롬프팅의 한계(시각 또는 언어 브랜치 중 하나만 적응)를 해결하기 위해 완전한 다중모달 프롬프팅 전략을 제안한다.
- 공유된 함수를 통해 두 모odal 간에 프롬프트를 명시적으로 결합함으로써 시각 및 언어 표현 간의 정렬을 향상시킨다.
- 시각 및 언어 브랜치의 여러 트랜스포머 블록에서 별도의 프롬프트를 학습함으로써 점진적이고 단계적인 적응을 가능하게 한다.
- 모델 복잡도나 추론 비용을 증가시키지 않으면서도 새로운 클래스, 알려지지 않은 도메인, 교차 데이터셋 전이에 대한 일반화 능력을 향상시킨다.
- 기존의 프롬프트 학습 방법에 비해 최소한의 파라미터 및 FLOP 오버헤드로 강력한 성능을 달성한다.
제안 방법
- MaPLe는 시각 및 언어 트랜스포머 브랜치에서 모두 문맥 프롬프트를 학습시키는 브랜치 인식형 계층적 프롬프트를 도입하며, 나머지 CLIP는 동결 상태로 유지한다.
- 시각 프롬프트가 해당 언어 프롬프트에 조건을 받는 V-L 결합 함수 $\mathcal{F}$ 를 활용하여 상호 기울기 전파 및 상호 보완성을 강제한다.
- 다양한 트랜스포머 블록을 통해 프롬프트를 독립적으로 학습시켜 단계별 특징 관계를 점진적으로 모델링하고 문맥 이해를 풍부하게 한다.
- 각 레이어에 대해 학습 가능한 프롬프트 임베딩을 사용하며, 레이어 간에 공유된 결합을 통해 일관성 유지 및 중복 감소를 도모한다.
- 프롬프트를 학습한 후, 동결된 CLIP 인코더를 기반으로 엔드 투 엔드로 훈련하며, 이미지 및 텍스트 임베딩 간의 대비 손실을 최적화한다.
- Co-CoOp 대비 2.85% 더 많은 파라미터만 추가하고, FLOPs는 0.1% 미만으로 증가시켜 효율성을 유지한다.

실험 결과
연구 질문
- RQ1CLIP의 시각 및 언어 브랜치에서의 공동 프롬프팅이 단일 모달 프롬프팅보다 더 나은 정렬과 일반화 성능을 달성할 수 있는가?
- RQ2공유된 함수를 통해 시각 및 언어 프롬프트를 결합할 경우, 다양한 최종 응용 과제에서 성능과 내성에 어떤 영향을 미치는가?
- RQ3다양한 트랜스포머 블록에서 프롬프트를 학습하는 깊이 있는 프롬프팅이 얕은 프롬프팅에 비해 특징 표현 및 일반화 능력을 향상시키는가?
- RQ4MaPLe는 도메인 이동, 교차 데이터셋 전이, 소수의 새로운 클래스 일반화 상황에서 기존 최고 성능 기법보다 어떻게 성능을 내는가?
- RQ5다중모달 프롬프트 학습에서 성능 향상과 계산 효율성 간의 상충 관계는 어떠한가?
주요 결과
- MaPLe는 11개의 다양한 이미지 인식 데이터셋에서 신규 클래스 정확도에 대해 절대적 향상 3.45%와 조화 평균에 대해 2.72% 향상되며, Co-CoOp를 능가한다.
- 도메인 일반화 벤치마크에서 MaPLe는 Co-CoOp 대비 조화 평균 1.75% 향상되었으며, 모든 타겟 데이터셋에서 일관된 성능 향상을 보였다.
- 추론 속도가 높아, 배치 크기 16일 때 239 FPS를 달성하여 Co-CoOp보다 빠르며, 일정한 FPS를 유지하는 점을 감안할 때 뚜렷한 성능 우월성을 보였다.
- 제거 실험 결과, 프롬프트 깊이 9가 최적의 성능을 내며, 더 긴 프롬프트 길이는 과적합으로 인해 새로운 클래스 일반화에 악영향을 미친다.
- 공유된 결합 함수를 사용하는 경량 버전인 MaPLe†은 오직 0.33%의 파라미터 증가로도 78.11%의 조화 평균을 달성하여, 성능 향상이 파라미터 수에 기인하지 않음을 입증한다.
- 다중모달 프롬프트를 사용함에도 불구하고, MaPLe는 CoOp 대비 FLOPs 증가율이 오직 0.1%에 불과하여 높은 계산 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.