[논문 리뷰] Dual Modality Prompt Tuning for Vision-Language Pre-Trained Model
이 논문은 소수의 예시로 분류하는 비전-언어 모델 성능을 햖थ기 위해 학습 가능한 텍스트 및 시각 프롬프트를 동시에 최적화하는 새로운 방법인 이중 모odal 프롬프트 튜닝(Dual Modality Prompt Tuning, DPT)을 제안한다. 텍스트 토큰과 이미지 토큰 간의 교차 attention을 통해 클래스 인식 시각 프롬프트를 동적으로 생성함으로써, 목표 개념에 대한 특징 집중도를 향상시킨다. 이로 인해 16-shot 설정에서 11개 데이터셋에 대해 기존 방법들을 크게 능가하는 최신 기준 성능인 79.47%의 정확도를 달성한다.
With the emergence of large pre-trained vison-language model like CLIP, transferable representations can be adapted to a wide range of downstream tasks via prompt tuning. Prompt tuning tries to probe the beneficial information for downstream tasks from the general knowledge stored in the pre-trained model. A recently proposed method named Context Optimization (CoOp) introduces a set of learnable vectors as text prompt from the language side. However, tuning the text prompt alone can only adjust the synthesized "classifier", while the computed visual features of the image encoder can not be affected , thus leading to sub-optimal solutions. In this paper, we propose a novel Dual-modality Prompt Tuning (DPT) paradigm through learning text and visual prompts simultaneously. To make the final image feature concentrate more on the target visual concept, a Class-Aware Visual Prompt Tuning (CAVPT) scheme is further proposed in our DPT, where the class-aware visual prompt is generated dynamically by performing the cross attention between text prompts features and image patch token embeddings to encode both the downstream task-related information and visual instance information. Extensive experimental results on 11 datasets demonstrate the effectiveness and generalization ability of the proposed method. Our code is available in https://github.com/fanrena/DPT.
연구 동기 및 목표
- 기존의 프롬프트 튜닝 방법이 이미지 특징를 고정한 채 텍스트 프롬프트만 최적화하는 데에 그쳐, 시각 표현을 최종 작업에 적응시키지 못하는 한계를 해결하기 위해.
- 학습 가능한 시각 프롬프트를 통해 비전 인코더가 목표 시각 개념에 집중할 수 있도록 함으로써 특징 정렬을 향상시키기 위해.
- 텍스트 및 이미지 임베딩 간의 교차 attention을 통해 작업 특화 및 인스턴스 특화 정보를 통합하는 클래스 인식 시각 프롬프트 메커니즘을 개발하기 위해.
- 다양한 소수의 예시 비전 기반 벤치마크에서 이중 모달 프롬프트 튜닝의 효과성과 일반화 능력을 입증하기 위해.
- 단일 모달 프롬프트 튜닝보다 이중 모달의 동시 튜닝이 더 뛰어난 성능을 내는지 확인하기 위해.
제안 방법
- 텍스트 프롬프트(언어 스트림 내의 학습 가능한 벡터)와 시각 프롬프트(이미지 패치 토큰에 삽입된 학습 가능한 벡터)를 공동으로 종단 간(end-to-end) 방식으로 최적화하는 이중 모달 프롬프트 튜닝(DPT) 프레임워크를 도입한다.
- 비전 트랜스포머(Vision Transformer, ViT) 인코더의 각 트랜스포머 블록 이전에 가중치를 학습할 수 있는 매개변수를 삽입함으로써 시각 프롬프트를 적용하며, 자기 attention 메커니즘을 통해 이미지 패치 토큰 임베딩을 수정한다.
- 클래스 인식 시각 프롬프트 튜닝(CAVPT)을 제안하며, 이는 텍스트 프롬프트 특징와 이미지 패치 토큰 임베딩 간의 교차 attention을 통해 시각 프롬프트를 동적으로 생성한다.
- 교차 attention을 통해 텍스트 프롬프트에서 온 최종 작업 정보를 시각 특징에 통합함으로써, 모델이 관련 있는 시각 개념에 더 강하게 집중할 수 있도록 한다.
- 사전 학습된 이미지 및 텍스트 인코더는 그대로 유지하고, 오직 프롬프트 매개변수만 튜닝함으로써 최소한의 파라미터로 효율적인 적응을 보장한다.
- 텍스트 및 시각 프롬프트 감독의 가중 조합을 사용하며, 하이퍼파라미터 α가 두 모달 간의 균형을 조절한다.
실험 결과
연구 질문
- RQ1텍스트 및 시각 프롬프트의 동시 튜닝이 단일 모달 프롬프트 튜닝을 넘어서 소수의 예시 비전-언어 분류 성능을 향상시킬 수 있는가?
- RQ2고정되거나 인식되지 않는 시각 프롬프트에 비해, 동적으로 생성되는 클래스 인식 시각 프롬프트가 목표 시각 개념에 대한 주의 집중을 향상시키는가?
- RQ3다양한 소수의 예시 데이터셋에서 DPT의 성능은 제로샷 CLIP, CoOp 및 기타 프롬프트 튜닝 베이스라인과 비교해 어떻게 되는가?
- RQ4과적합을 방지하면서 성능을 극대화하기 위한 최적의 시각 프롬프트 길이와 구성은 무엇인가?
- RQ5DPT의 효과성은 ViT-B/16 및 ViT-B/32와 같은 다양한 비전 트랜스포머 백본에 대해 일반화되는가?
주요 결과
- DPT는 16-shot 설정에서 11개의 소수의 예시 데이터셋에 대해 평균 정확도 79.47%를 기록하며 새로운 최고 기록을 달성하였으며, 제로샷 CLIP(61.32%)와 CoOp(76.02%)를 크게 능가한다.
- 제거 분석 결과, 시각 프롬프트 튜닝만으로 CoOp 대비 정확도가 3.45% 향상되었고, 양 모달의 동시 튜닝은 추가로 0.45% 성능 향상을 이끌어냈다.
- 10개의 시각 프롬프트 토큰을 사용한 클래스 인식 시각 프롬프트 튜닝(CAVPT)이 평균 정확도 79.47%를 기록하며, 짧은(5개) 및 긴(50개) 프롬프트 길이보다 뛰어난 성능을 보였다.
- DPT는 다양한 ViT 백본에 대해 잘 일반화되며, ViT-B/16에서는 78.96%, ViT-B/32에서는 79.47%의 정확도를 기록하여 강건성을 확인했다.
- 시각화 결과는 DPT가 참조 대상 객체에 더 효과적으로 주의를 집중시키는 반면, CoOp 및 제로샷 CLIP과 같은 베이스라인 방법은 다수의 관련 없는 객체를 강조한다는 점을 확인했다.
- α 값의 다양한 조합에 대한 제거 분석 결과, 균형 잡힌 조합(α=0.5)이 최적의 성능을 내며, 이는 두 모달이 최종 결과에 상당한 기여를 한다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.