[논문 리뷰] Prompting Large Pre-trained Vision-Language Models For Compositional Concept Learning
이 논문은 소프트 프롬프팅과 소프트 임베딩 레이어라는 두 가지 학습 가능한 구성 요소를 도입하여, 대규모 시각어휘모델(VLMs)의 조합적 제로샷 학습(CZSL) 능력을 향상시키는 파rameter 효율적인 프롬프팅 프레임워크인 PromptCompVL을 제안한다. 이러한 구성 요소를 통해 CLIP를 재프로그래밍함으로써, MIT-States에서 최신 기술 수준(SOTA) 성능을 달성하고 CLIP 기반 베이스라인보다 일관된 성능 향상을 보이며, 조합적 개념 학습을 위한 소프트 프롬프팅과 소프트 임베딩의 병합이 효과적임을 입증한다.
This work explores the zero-shot compositional learning ability of large pre-trained vision-language models(VLMs) within the prompt-based learning framework and propose a model ( extit{PromptCompVL}) to solve the compositonal zero-shot learning (CZSL) problem. extit{PromptCompVL} makes two design choices: first, it uses a soft-prompting instead of hard-prompting to inject learnable parameters to reprogram VLMs for compositional learning. Second, to address the compositional challenge, it uses the soft-embedding layer to learn primitive concepts in different combinations. By combining both soft-embedding and soft-prompting, extit{PromptCompVL} achieves state-of-the-art performance on the MIT-States dataset. Furthermore, our proposed model achieves consistent improvement compared to other CLIP-based methods which shows the effectiveness of the proposed prompting strategies for CZSL.
연구 동기 및 목표
- 프롬프팅 기반 프레임워크 내에서 대규모 사전 훈련된 시각어휘모델(VLMs)의 제로샷 조합적 학습 능력을 조사하는 것.
- 훈련 중에 볼 수 없었던 새로운 속성-객체 쌍을 인식해야 하는 조합적 제로샷 학습(CZSL)에서의 분포 이탈 문제를 해결하는 것.
- 모델 전체를 미세조정하지 않고 CLIP를 재프로그래밍할 수 있는 파rameter 효율적인 프롬프팅 방법을 도입하여 VLM의 CZSL 일반화 능력을 향상시키는 것.
- 기본 개념과 그 조합을 학습하기 위해 소프트 프롬프팅과 소프트 임베딩을 결합하는 것이 얼마나 효과적인지 탐구하는 것.
제안 방법
- CLIP의 하드 프롬프팅 벡터를 학습 가능한 연속적인 프롬프트 임베딩으로 대체하여 소프트 프롬프팅을 도입함으로써, CZSL를 위한 모델 재프로그래밍을 수행한다.
- 고정된 어휘 임베딩 레이어를 학습 가능한 소프트 임베딩 레이어로 대체하여, 기본 개념 임베딩(예: 'sliced', 'apple')을 동적으로 학습하고 업데이트한다.
- CLIP의 사전 훈련된 이미지 및 텍스트 인코더(ViT-L/14 또는 ResNet)를 사용하며, 훈련 중에 고정한다. 소프트 프롬프팅과 소프트 임베딩 파ram터만 업데이트한다.
- 학습된 소프트 임베딩과 소프트 프롬프트를 사용하여 조합적 개념(예: 'sliced apple')을 구성하는 텍스트 입력을 구성하고, 이를 CLIP의 텍스트 인코더를 통해 인코딩한다.
- 코사인 유사도를 사용한 대비 손실과 교차 엔트로피 손실을 활용하여 소프트 프롬프팅 및 소프트 임베딩 파ram터를 최적화한다.
- 추론 시, 공유된 공간에서 이미지 및 텍스트 임베딩 간의 최대 코사인 유사도를 갖는 조합적 레이블을 선택한다.
실험 결과
연구 질문
- RQ1CLIP와 같은 대규모 사전 훈련된 시각어휘모델이 미세조정 없이 조합적 제로샷 학습에 일반화할 수 있는가?
- RQ2소프트 프롬프팅이 조합적 개념 학습 작업을 위한 VLM 재프로그래밍에 얼마나 효과적인가?
- RQ3기본 개념을 위한 학습 가능한 소프트 임베딩 레이어를 도입하면, 새로운 속성-객체 조합으로의 일반화 능력이 향상되는가?
- RQ4소프트 프롬프팅과 소프트 임베딩을 병행 사용할 경우, 기존의 CLIP 기반 프롬프팅 방법보다 CZSL 벤치마크에서 더 우수한 성능을 낼 수 있는가?
주요 결과
- PromptCompVL은 MIT-States 데이터셋에서 클로즈 월드 및 오픈 월드 CZSL 설정 모두에서 최신 기술 수준(SOTA) 성능을 달성하며, 비-CLIP 및 CLIP 기반 베이스라인을 모두 압도한다.
- MIT-States에서 PromptCompVL은 가장 높은 본문 인식 정확도와 경쟁 가능한 미관측 정확도를 기록했으며, COOP 및 CSP와 같은 다른 CLIP 기반 방법보다 일관된 성능 향상을 보였다.
- MIT-States에서 본문 및 미관측 조합 모두에 걸쳐 일관된 성능 향상을 보이며, 조합적 학습에서의 분포 이탈 문제에 대한 강건성을 입증했다.
- UT-Zappos에서 최신 기술 수준 성능를 달성하지 못했지만, 클로즈 월드 설정에서 다른 CLIP 기반 방법보다 우수한 성능을 보이며, 더 넓은 도메인에서도 프롬프팅 전략의 효과성을 입증했다.
- 절단 분석 결과, 소프트 프롬프팅만으로도 성능 향상이 크게 이루어지며, 소프트 임베딩을 추가로 도입할 경우 고정 임베딩을 넘어서는 조합적 일반화 능력 향상이 이루어짐을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.