[논문 리뷰] ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free Domain Adaptation
ReCLIP는 CLIP와 같은 시각-언어 모델을 위한 소스 프리 도메인 어댑테이션 방법을 제안하며, 학습된 투영 공간을 통해 시각적 및 텍스트 임베딩을 재정렬하고, 레이블 전파를 통해 고신뢰도의 가짜 레이블을 생성한다. 이후 교차 모odal 자체 학습을 적용하여 인코더를 반복적으로 개선함으로써 22개의 벤치마크에서 제로샷 정확도를 69.83%에서 74.94%로 향상시킨다.
Large-scale Pre-Training Vision-Language Model such as CLIP has demonstrated outstanding performance in zero-shot classification, e.g. achieving 76.3% top-1 accuracy on ImageNet without seeing any example, which leads to potential benefits to many tasks that have no labeled data. However, while applying CLIP to a downstream target domain, the presence of visual and text domain gaps and cross-modality misalignment can greatly impact the model performance. To address such challenges, we propose ReCLIP, the first source-free domain adaptation method for vision-language models, which does not require any source data or target labeled data. ReCLIP first learns a projection space to mitigate the misaligned visual-text embeddings and learns pseudo labels, and then deploys cross-modality self-training with the pseudo labels, to update visual and text encoders, refine labels and reduce domain gaps and misalignments iteratively. With extensive experiments, we demonstrate ReCLIP reduces the average error rate of CLIP from 30.17% to 25.06% on 22 image classification benchmarks. Code available at https://github.com/michiganleon/ReCLIP_WACV.
연구 동기 및 목표
- 시각-텍스트 도메인 갭과 교차 모달 불일치로 인해 CLIP의 다운스트림 타겟 도메인에서 성능 저하 문제를 해결한다.
- 라벨이 부여된 타겟 데이터 또는 소스 데이터가 필요로 하는 기존 도메인 어댑테이션 방법의 한계를 극복한다.
- 소스 데이터 또는 타겟 레이블에 접근할 수 없는 안정적이고 효과적인 소스 프리 어댑테이션 프레임워크를 개발한다.
- 가짜 레이블링과 자체 학습을 통해 시각적 및 텍스트 인코더를 공동으로 개선하여 제로샷 일반화 성능을 향상시킨다.
- 사전 훈련된 CLIP 모델만을 사용하여 타겟 데이터에 대해 단 한 번의 효율적인 어댑테이션을 가능하게 한다.
제안 방법
- 시각적 및 텍스트 임베딩에서 여분이거나 클래스에 관계없는 특징을 제거하기 위해 투영 공간을 학습하여 불일치를 줄인다.
- 국소적 이웃 구조를 기반으로 투영된 공간에서 레이블 전파를 사용하여 정확한 가짜 레이블을 생성한다.
- 고신뢰도 가짜 레이블을 사용하여 교차 모달 자체 학습을 적용하여 시각적 및 텍스트 인코더를 공동으로 업데이트한다.
- 학습을 두 개의 병렬 구성 요소로 분리한다: 하나는 텍스트 인코더를 미세조정하면서 시각적 인코더를 동결하고, 반대로 다른 하나는 시각적 인코더를 미세조정하면서 텍스트 인코더를 동결한다.
- 두 브랜치 간에 가짜 레이블을 공유하여 어댑테이션 과정의 안정성과 일관성을 향상시킨다.
- CLIP에서 다수의 템플릿 증강 텍스트 임베딩을 사용하여 텍스트 표현의 다양성과 강건성을 향상시킨다.
실험 결과
연구 질문
- RQ1소스 데이터 또는 타겟 레이블에 접근할 수 없을 때, CLIP의 제로샷 성능을 향상시킬 수 있는가?
- RQ2투영 공간은 시각-텍스트 임베딩 불일치와 도메인 갭을 줄이는 데 얼마나 효과적인가?
- RQ3투영된 공간에서 레이블 전파가 직접 클러스터링 또는 k-NN 방법보다 더 신뢰할 수 있는 가짜 레이블을 생성하는가?
- RQ4공유된 가짜 레이블을 사용한 교차 모달 자체 학습은 소스 프리 환경에서 어댑테이션의 안정성과 성능을 향상시키는가?
- RQ5ReCLIP 프레임워크는 다양한 시각-언어 모델 및 아키텍처에 대해 얼마나 일반화 가능한가?
주요 결과
- ReCLIP는 22개의 이미지 분류 벤치마크에서 CLIP의 평균 상위-1 정확도를 69.83%에서 74.94%로 향상시켰다.
- 텍스트 임베딩 품질이 핵심적인 세부 분류 데이터셋인 Birdsnap 및 RESISC45에서 뚜렷한 성능 향상을 달성했다.
- 투영된 공간에서의 레이블 전파(P₂)가 k-NN 및 클러스터링 기반 베이스라인을 모두 초월하여 가장 높은 향상을 이뤘다.
- ReCLIP는 SLIP, DeCLIP 및 다양한 CLIP 변형 모델을 포함하여 다양한 아키텍처에서 강력한 일반화 성능을 보였다.
- 어댑테이션은 효율적이며, 단일 V100 GPU에서 타겟 도메인당 0.5에서 5 GPU 시간이 소요된다.
- 제거 실험을 통해 시각적 및 텍스트 어댑테이션 브랜치 간의 가짜 레이블 공유가 안정성과 성능 향상에 크게 기여한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.