[논문 리뷰] Prompt Tuning with Soft Context Sharing for Vision-Language Models
이 논문은 학습 가능한 메타 프롬프트와 태스크 이름을 입력으로 받아, 공유 메타 네트워크를 통해 태스크별로 연속적으로 소프트 공유되는 프롬프트 벡터를 생성하는 새로운 다중 태스크 프롬프트 튜닝 방법인 SoftCPT를 제안한다. 실험 결과 SoftCPT는 세 개의 소수의 이미지 인식 데이터셋에서 CoOp와 하드 프롬프트 공유 방법을 뛰어넘어 정확도와 안정성 측면에서 뛰어난 성능을 보였다.
Vision-language models have recently shown great potential on many tasks in computer vision. Meanwhile, prior work demonstrates prompt tuning designed for vision-language models could acquire superior performance on few-shot image recognition compared to linear probe, a strong baseline. In practice, many few-shot tasks are inherently correlated, particularly within specialized domains. However, such information is overlooked previously. Inspired by the fact that modeling task relationship by multi-task learning can usually boost performance, we propose a novel method SoftCPT (Soft Context Sharing for Prompt Tuning) to tune pre-trained vision-language models on multiple target few-shot tasks jointly. Specifically, we design a task-shared meta network to generate prompt context for each task using task name together with a learnable task context as input. The parameters of this meta network as well as the task context are tuned on the joint training set of all tasks. As such, the prompt context of all tasks will be shared in a soft manner. Extensive experiments across four multi-task few-shot datasets covering 44 tasks and 1593 categories demonstrate that SoftCPT significantly outperforms single-task prompt tuning methods, highlighting the effectiveness of multi-task learning for vision-language prompt tuning. Code is available at https://github.com/kding1225/softcpt.
연구 동기 및 목표
- 소수의 비전-언어 학습에서 단일 태스크 프롬프트 튜닝의 한계를 보완하기 위해 태스크 간 관계를 활용하고자 한다.
- 다중 태스크 학습이 관련 태스크가 있는 특수 분야에서 비전-언어 모델의 프롬프트 튜닝 성능을 향상시킬 수 있는지 탐색하고자 한다.
- 하드 제약 없이 여러 태스크 간에 연속적이고 소프트한 프롬프트 표현 공유를 가능하게 하는 방법을 설계하고자 한다.
- 관련 태스크 간 공동 프롬프트 토닝을 통해 일반화 능력과 소수의 이미지 인식에서의 안정성을 향상시키고자 한다.
- 다중 태스크 프롬프트 튜닝이 단일 태스크 튜닝 및 프롬프트 전이 방법을 모두 능가할 수 있음을 검증하고자 한다.
제안 방법
- 학습 가능한 메타 프롬프트와 사전 정의된 태스크 이름을 입력으로 받아, 태스크별로 프롬프트 벡터를 생성하기 위해 태스크 공유 메타 네트워크를 도입한다.
- 메타 네트워크는 메타 프롬프트와 태스크 이름의 연결을 CLIP의 텍스트 인코더를 통해 처리하여 태스크별 특징을 생성한다.
- 경량 서브 네트워크가 태스크 특징을 연속적이고 소프트한 프롬프트 벡터로 변환하여, 기저 모델의 파라미터를 다르게 하면서도 파라미터 공유를 가능하게 한다.
- 메타 네트워크와 메타 프롬프트는 모든 타겟 소수의 훈련 세트의 결합된 데이터를 통해 공동으로 미세조정되어 태스크 간 지식 전이가 가능해진다.
- SoftCPT는 클래스 무관 프롬프트 전략을 사용하여, 각 태스크 내의 모든 클래스가 메타 네트워크에 의해 생성된 동일한 프롬프트 벡터를 공유한다.
- 하드 파라미터 공유를 피하기 위해 공유 가능한 학습 가능한 아키텍처를 통해 태스크별로 프롬프트를 학습함으로써 적응성과 성능 향상을 도모한다.
실험 결과
연구 질문
- RQ1다중 태스크 학습을 통해 프롬프트 튜닝을 활용하면 소수의 이미지 인식 성능이 향상될 수 있는가?
- RQ2태스크 간에 연속적이고 소프트한 프롬프트 파라미터 공유 방식이 하드 공유나 단일 태스크 튜닝보다 더 나은 일반화 성능을 보일 수 있는가?
- RQ3성능과 안정성 측면에서 제안된 SoftCPT 방법은 프롬프트 전이 및 앙상블 방법과 비교해 어떻게 성과를 내는가?
- RQ4실제 소수의 시나리오에서 태스크 간 관련성과 프롬프트 특징에 반영된 태스크 상관관계 간의 일치 정도는 어느 정도인가?
- RQ5비전-언어 모델의 주요 파라미터를 미세조정하지 않고도 공유 메타 네트워크가 고품질의 태스크별 프롬프트를 효과적으로 생성할 수 있는가?
주요 결과
- 16-샷 설정에서 General-10, Plant-6, Fashion-20 데이터셋에서 각각 CoOp-CA보다 0.73%, 5.09%, 0.93% 높은 성능을 기록했다.
- General-10에서는 RSD(상대 표준편차)가 1.28%로 낮고, Plant-6에서는 3.70%로 나타나 태스크 간 성능 안정성이 뛰어나다는 것을 보여주었다.
- General-10에서 CoOp-MT 대비 RSD를 12.4% 감소시켜 다중 태스크 환경에서의 강건성 향상을 입증했다.
- SoftCPT-NATA의 상관도 지도는 오라클 태스크 유사도와 0.32의 상관계수를 보였으며, CoOp-CA의 -0.03보다 유의미하게 높아 실제 태스크 유사도와의 일치도가 뛰어나다는 것을 시사했다.
- 오라클 및 앙상블 방법을 통한 프롬프트 전이에서는 소폭의 성능 향상(예: Plant-6에서 약 0.07% 향상)에 그쳤지만, SoftCPT는 상당한 성능 향상을 기록하여 그 우월성을 입증했다.
- SoftCPT-NATS는 General-10에서 67.04% ± 0.23, Plant-6에서 67.13% ± 1.15를 기록하여 정확도와 안정성 측면에서 CoOp-CA 및 오라클 기준선을 모두 초월했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.