[논문 리뷰] C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
이 논문은 레이블이 없는 조건에서도 평균 텍스트 특징 분산(Averge Text Feature Dispersion, ATFD)을 최대화하여 모델 캘리브레이션을 향상시키는 새로운 테스트 시점 프롬프트 튜닝 방법인 C-TPT를 제안한다. CLIP의 내재된 특성을 활용함으로써 C-TPT는 추론 중에 프롬프트를 최적화하여 과신도를 감소시키며, 여러 데이터셋과 CLIP 아키텍처에서 기존 성능을 유지하거나 향상시키면서 기대 캘리브레이션 오차(Expected Calibration Error, ECE)를 크게 낮춘다.
In deep learning, test-time adaptation has gained attention as a method for model fine-tuning without the need for labeled data. A prime exemplification is the recently proposed test-time prompt tuning for large-scale vision-language models such as CLIP. Unfortunately, these prompts have been mainly developed to improve accuracy, overlooking the importance of calibration, which is a crucial aspect for quantifying prediction uncertainty. However, traditional calibration methods rely on substantial amounts of labeled data, making them impractical for test-time scenarios. To this end, this paper explores calibration during test-time prompt tuning by leveraging the inherent properties of CLIP. Through a series of observations, we find that the prompt choice significantly affects the calibration in CLIP, where the prompts leading to higher text feature dispersion result in better-calibrated predictions. Introducing the Average Text Feature Dispersion (ATFD), we establish its relationship with calibration error and present a novel method, Calibrated Test-time Prompt Tuning (C-TPT), for optimizing prompts during test-time with enhanced calibration. Through extensive experiments on different CLIP architectures and datasets, we show that C-TPT can effectively improve the calibration of test-time prompt tuning without needing labeled data. The code is publicly accessible at https://github.com/hee-suk-yoon/C-TPT.
연구 동기 및 목표
- CLIP와 같은 시각-언어 모델의 테스트 시점 프롬프트 튜닝에서 정확도 향상에도 불구하고 캘리브레이션 부족 문제를 해결하기 위해.
- 테스트 시점 적응 중에 사용할 수 있는 내재적이고 데이터 기반의 모델 캘리브레이션 지표를 식별하기 위해.
- 레이블 데이터에 의존하지 않고도 테스트 시점 프롬프트 튜닝 중 캘리브레이션을 향상시키는 방법을 개발하기 위해.
- CLIP 모델에서 텍스트 특징 분산과 캘리브레이션 오차 사이의 정량적 연관성을 확립하기 위해.
- 제안된 방법이 다양한 시각-언어 벤치마크와 CLIP 아키텍처에 걸쳐 일반화 가능하고 효과적인지를 입증하기 위해.
제안 방법
- 이 방법은 CLIP 텍스트 인코더의 출력 공간에서 클래스 임bed된 텍스트 특징의 산포도를 측정함으로써 모델 캘리브레이션의 대체 지표로 평균 텍스트 특징 분산(ATFD)을 도입한다.
- C-TPT는 레이블에 접근할 수 없더라도 기울기 하강법을 사용하여 ATFD를 최대화하는 정규화 항으로서의 프롬프트 최적화를 테스트 시점에 수행함으로써 캘리브레이션을 향상시킨다.
- 높은 텍스트 특징 분산이 낮은 기대 캘리브레이션 오차(ECE)와 상관관계가 있음을 관찰함으로써, 데이터 기반 캘리브레이션을 가능하게 한다.
- 이 방법은 추론 중에 적용되며, 입력 이미지마다 프롬프트를 적응시켜 정확도와 캘리브레이션을 동시에 향상시킨다.
- C-TPT는 ViT-B/16, RN50 등 여러 CLIP 변종과 ImageNet, ImageNet-A, ImageNet-V2 등 다양한 데이터셋에서 검증되었으며, 캘리브레이션 향상이 일관되게 관찰되었다.
- 이 방법은 CoOp와 같은 훈련 시점 프롬프트 튜닝에도 확장되었으며, C-TPT가 ECE 향상에 정규화 항으로서 기능함을 보여, 광범위한 적용 가능성을 입증했다.
실험 결과
연구 질문
- RQ1레이블 데이터를 사용하지 않고도 테스트 시점 프롬프트 튜닝을 통해 모델 캘리브레이션을 향상시킬 수 있는가?
- RQ2CLIP의 내재된, 데이터 기반의 특성 중 캘리브레이션 성능과 상관관계가 있는 것이 존재하는가?
- RQ3CLIP 임베딩 공간에서 텍스트 특징의 분산을 증가시키면 더 잘 캘리브레이션된 예측이 이루어지는가?
- RQ4제안된 방법이 다양한 데이터셋과 CLIP 아키텍처에 걸쳐 일반화 가능한가?
- RQ5C-TPT는 훈련 시점 프롬프트 튜닝에 응용될 수 있으며, 정규화 항으로서의 기능을 수행할 수 있는가?
주요 결과
- C-TPT는 ImageNet-A와 ImageNet-V2를 포함한 여러 데이터셋에서 평균적으로 기대 캘리브레이션 오차(ECE)를 최대 50%까지 감소시켰으며, 레이블 데이터를 사용하지 않았다.
- ImageNet-A에서 CoOp에 적용했을 때 C-TPT는 ECE를 3.00에서 1.48로 감소시켜, 훈련 시점 튜닝에서 정규화 항으로서의 효과를 입증했다.
- Caltech에서는 ECE가 1.48로, Cars에서는 1.79로, 기존의 기준선 CoOp보다 캘리브레이션 성능이 뛰어나면서도 경쟁 가능한 정확도를 유지했다.
- ImageNet과 다른 데이터셋 간의 ATFD 순위 간 강한 음의 상관관계(Spearman ρ = 0.92)를 관찰하여, 한 데이터셋에서의 높은 분산이 다른 데이터셋으로 일반화됨을 시사했다.
- C-TPT는 ImageNet-Sketch와 EuroSAT와 같은 도메인 이탈이 어려운 케이스를 포함한 모든 평가된 데이터셋에서 캘리브레이션을 향상시켰으며, ECE 감소 폭이 최대 40%에 이르렀다.
- 성능 저하 없이 정확도를 유지하거나 약간 향상시키며 과신도를 크게 감소시켜, 더 나은 캘리브레이션이 성능에 손해를 주지 않음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.