[논문 리뷰] Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
이 논문은 강화학습을 통한 CLIP 피드백(Reinforcement Learning with CLIP Feedback, RLCF)을 제안하며, 테스트 시간 적응(TTA) 방법으로서 시각-언어 모델을 작업 목표에 맞추기 위해 CLIP를 보상 모델로 사용함으로써 엔트로피 최소화에 의한 과적합을 방지한다. 동적 기준선을 통해 CLIP 점수를 최대화하는 강화학습을 통해 RLCF는 최소한의 감독으로 이미지 분류, 검색, 캡션 생성 작업 전반에서 뚜렷한 제로샷 일반화 성능 향상을 달성한다.
One fascinating aspect of pre-trained vision-language models~(VLMs) learning under language supervision is their impressive zero-shot generalization capability. However, this ability is hindered by distribution shifts between the training and testing data. Previous test time adaptation~(TTA) methods for VLMs in zero-shot classification rely on minimizing the entropy of model outputs, tending to be stuck in incorrect model predictions. In this work, we propose TTA with feedback to rectify the model output and prevent the model from becoming blindly confident. Specifically, a CLIP model is adopted as the reward model during TTA and provides feedback for the VLM. Given a single test sample, the VLM is forced to maximize the CLIP reward between the input and sampled results from the VLM output distribution. The proposed extit{reinforcement learning with CLIP feedback~(RLCF)} framework is highly flexible and universal. Beyond the classification task, with task-specific sampling strategies and a proper reward baseline choice, RLCF can be easily extended to not only discrimination tasks like retrieval but also generalization tasks like image captioning, improving the zero-shot generalization capacity of VLMs. According to the characteristics of these VL tasks, we build different fully TTA pipelines with RLCF to improve the zero-shot generalization ability of various VLMs. Extensive experiments along with promising empirical results demonstrate the effectiveness of RLCF. The code is available at https://github.com/mzhaoshuai/RLCF.
연구 동기 및 목표
- 시각-언어 모델에서 엔트로피 최소화로 인한 과적합을 유발하는 완전한 테스트 시간 적응(TTA)의 문제를 해결하기 위해.
- 학습 데이터나 인간 주석에 접근할 수 없는 상황에서도 추론 중 모델 출력을 작업 목표에 맞추기 위해.
- 다중 모odal 작업을 위한 유연하고 확장 가능한 피드백 메커니즘을 개발하기 위해 CLIP를 보상 모델로 사용하기 위해.
- 이미지 분류, 검색, 캡션 생성과 같은 시각-언어 작업에서 제로샷 및 교차 도메인 성능을 향상시키기 위해.
- 간단한 CLIP 기반 보상 설계와 동적 기준선을 사용한 방법이 TTA에서 표준 엔트로피 최소화보다 우수한 성능을 낼 수 있음을 입증하기 위해.
제안 방법
- 테스트 시간 적응 중 피드백을 제공하기 위해 CLIP를 보상 모델로 사용하여 이미지-텍스트 쌍의 유사도 기반 점수를 할당한다.
- 동적 기준선을 적용: 샘플된 후보군의 평균 CLIP 점수로, 학습 안정성 향상과 정렬 성능 향상에 기여한다.
- REINFORCE 알고리즘과 정책 그래디언트 업데이트를 사용하여 추론 중 기대 CLIP 보상 최대화를 도모한다.
- 작업별 샘플링 전략을 도입: 분류 및 검색에는 상위-K 샘플링, 캡션 생성에는 빔 서치를 사용한다.
- 다중 테스트 샘플에서의 지식을 유지하기 위해 모멘텀 버퍼를 도입하여 시간이 지남에 따라 일반화 성능을 향상시킨다.
- 다양한 CLIP 모델을 통합하여 더 견고한 보상 앙상블을 형성할 수 있도록 지원한다.
실험 결과
연구 질문
- RQ1CLIP는 시각-언어 모델의 테스트 시간 적응에서 효과적인 자기지도 보상 모델로 기능할 수 있는가?
- RQ2CLIP 점수를 보상 신호로 사용할 경우, 엔트로피 최소화 대비 TTA에서 과적합을 방지할 수 있는가?
- RQ3RLCF는 다양한 시각-언어 작업 전반에서 제로샷 및 교차 도메인 성능 향상에 얼마나 효과적인가?
- RQ4평균 CLIP 점수 기반의 단순한 학습 가능한 기준선이 고정 또는 복잡한 보상 기준선을 능가할 수 있는가?
- RQ5모멘텀 버퍼는 순차적 테스트 시간 적응 중 일반화 성능 향상에 어느 정도 기여하는가?
주요 결과
- RLCF는 ImageNet-A, ImageNet-V2, ImageNet-R와 같은 OOD 벤치마크에서 이미지 분류 정확도를 크게 향상시켜 엔트로피 최소화 기반 TTA를 능가한다.
- 제로샷 이미지-텍스트 검색에서 RLCF는 MS-COCO에서 Flickr30K로의 전이 시 5.7% 높은 CIDEr 점수를 기록하여 뛰어난 제로샷 일반화 성능을 입증한다.
- 교차 도메인 이미지 캡션 생성에서 RLCF는 NoCaps에서 최대 9.2점, Flickr30K에서 최대 8.5점의 CIDEr 점수 향상을 기록하여 단일 테스트 샘플에서도 뛰어난 성능을 보인다.
- CLIPCap에 RLCF를 적용한 결과 기준 모델 대비 7.8점의 CIDEr 향상을 기록하여 고품질 캡션 생성 모델에서의 방법의 효과성을 입증한다.
- 모멘텀 버퍼는 다양한 작업 전반에서 일관되게 성능 향상을 이끌어내어 다수의 테스트 샘플에서 지식을 효과적으로 유지함을 시사한다.
- 더 단순한 샘플링 전략을 사용하는 RLCF-S는 대부분의 경우 RLCF와 유사한 성능을 보이며, 강건성과 실용성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.