[논문 리뷰] MmAP : Multi-modal Alignment Prompt for Cross-domain Multi-task Learning
이 논문은 CLIP를 사용하여 다중 도메인 다중 작업 학습을 위한 다중 모odal 정렬 프롬프트 방법인 MmAP를 제안한다. 이 방법은 크로네커 곱을 통해 텍스트 및 시각 프롬프트를 공동으로 튜닝하여 모odal 정렬을 유지한다. Office-Home와 miniDomainNet에서 전체 미세조정 파라미터의 약 ~0.09%만을 사용하여 최신 기술 수준의 성능을 달성하며, 모든 샷 설정에서 기존의 프롬프트 튜닝 베이스라인을 능가한다.
Multi-Task Learning (MTL) is designed to train multiple correlated tasks simultaneously, thereby enhancing the performance of individual tasks. Typically, a multi-task network structure consists of a shared backbone and task-specific decoders. However, the complexity of the decoders increases with the number of tasks. To tackle this challenge, we integrate the decoder-free vision-language model CLIP, which exhibits robust zero-shot generalization capability. Recently, parameter-efficient transfer learning methods have been extensively explored with CLIP for adapting to downstream tasks, where prompt tuning showcases strong potential. Nevertheless, these methods solely fine-tune a single modality (text or visual), disrupting the modality structure of CLIP. In this paper, we first propose Multi-modal Alignment Prompt (MmAP) for CLIP, which aligns text and visual modalities during fine-tuning process. Building upon MmAP, we develop an innovative multi-task prompt learning framework. On the one hand, to maximize the complementarity of tasks with high similarity, we utilize a gradient-driven task grouping method that partitions tasks into several disjoint groups and assign a group-shared MmAP to each group. On the other hand, to preserve the unique characteristics of each task, we assign an task-specific MmAP to each task. Comprehensive experiments on two large multi-task learning datasets demonstrate that our method achieves significant performance improvements compared to full fine-tuning while only utilizing approximately 0.09% of trainable parameters.
연구 동기 및 목표
- 표준 MTL 프레임워크에서 작업별 디코더로 인한 파라미터 폭발 문제를 해결한다.
- 단일 모달 프롬프트 튜닝(예: 텍스트 또는 시각적 모달만)의 한계를 극복하여 CLIP의 본질적인 모달 정렬을 유지한다.
- 프롬프트 튜닝 중에 모달 정렬을 유지함으로써 CLIP의 효율적이고 파라미터 효율적인 다중 작업 적응을 가능하게 한다.
- 유사한 작업들을 그룹화하여 상호 보완성을 확보하면서도 작업 고유의 특성을 유지하는 다중 작업 프롬프트 학습 프레임워크를 설계한다.
- 최소한의 학습 가능한 파라미터로 교차 도메인 다중 작업 벤치마크에서 강력한 일반화 성능을 달성한다.
제안 방법
- 공유 소스 프롬프트에서 텍스트 및 시각 프롬프트를 생성하는 다중 모달 정렬 프롬프트인 MmAP를 제안하며, 크로네커 곱을 사용해 튜닝 중에 교차 모달 정렬을 강제한다.
- 기울기 기반 작업 그룹화 전략을 도입하여 기울기 유사도를 기반으로 작업을 군집화하여 상호 배타적인 그룹을 형성하고, 공유된 MmAP 튜닝을 수행한다.
- 각 개별 작업에 대해 작업 고유의 MmAP를 할당하여 고유한 표현 특성을 유지한다.
- 그룹 공유 및 작업 고유의 MmAP를 조합한 다중 작업 프롬프트 학습 프레임워크를 구축하여 지식 공유와 작업 독립성의 균형을 이룬다.
- 추가 디코더 없이 CLIP의 사전 학습된 시각-언어 인코더를 활용하여 제로샷 일반화 및 파라미터 효율성을 달성한다.
- 백본 가중치가 아닌 프롬프트 파라미터만 학습하여 학습 가능한 파라미터를 전체 미세조정의 약 ~0.09%로 줄인다.
실험 결과
연구 질문
- RQ1CLIP에서 텍스트 및 시각 프롬프트를 공동으로 튜닝하는 것이 단일 모달 프롬프트 튜닝보다 모달 정렬을 더 잘 유지할 수 있는가?
- RQ2표준 프롬프트 튜닝과 비교했을 때, 다중 모달 프롬프트 정렬은 교차 도메인 다중 작업 학습에서 성능에 어떤 영향을 미치는가?
- RQ3기울기 기반 작업 그룹화가 유사한 작업 간의 보완성을 향상시켜 성능 향상에 기여하는가?
- RQ4그룹 공유 및 작업 고유의 프롬프트를 조합하는 것이 단일 유형만 사용하는 것보다 더 나은 성능을 내는가?
- RQ5파라미터 효율적인 프롬프트 튜닝 방법이 최소한의 학습 가능한 파라미터로 전체 미세조정 성능에 얼마나 가까이 다가갈 수 있는가?
주요 결과
- MmAP는 다중 모달 프롬프트 튜닝에서 MLP 베이스라인 대비 0.54% 향상된 성능을 기록하여 두 모달 간의 정보 공유가 향상됨을 입증한다.
- Office-Home에서 20% 샷 설정 하에 MmAP는 87.77%의 정확도를 달성하며, CoOp-MT, VPT-MT, MaPLe-MT를 포함한 모든 베이스라인을 능가한다.
- 기울기 기반 그룹화를 사용한 다중 작업 프롬프트 학습 프레임워크는 10% 데이터 설정에서 무작위 그룹화 대비 0.68% 향상되었고, 20% 설정에서는 0.85% 향상되었다.
- 1샷 설정에서는 모든 방법이 아트 및 리얼 월드 작업에서 제로샷 CLIP 성능 이하로 떨어지지만, MmAP는 3샷 이상에서 가장 큰 성능 격차 감소를 보이며 강력한 일반화 능력을 입증한다.
- MmAP는 학습 가능한 파라미터를 약 0.13M로 줄였고(MLP 베이스라인 대비 3.96M), 전체 미세조정 파라미터의 약 ~0.09%로 유지하면서도 높은 성능 유지를 달성한다.
- 제거 실험 결과, 그룹 공유 및 작업 고유의 MmAP 구성 요소 모두가 필수적임을 확인하였으며, 전체 프레임워크는 모든 제거된 변형보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.