Skip to main content
QUICK REVIEW

[논문 리뷰] A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)

Weijie Tu, Weijian Deng|arXiv (Cornell University)|2024. 02. 12.
Interpreting and Communication in Healthcare인용 수 4
한 줄 요약

이 논문은 다양한 시각적 요인 변화, 분포 외(Distribution Shift) 탐지, 예측 불확실성 校정에 대해 CLIP 모델의 강건성에 대한 종합적인 실증 연구를 수행한다. 다양한 아키텍처와 훈련 소스를 바탕으로 83개의 CLIP 모델과 127개의 ImageNet 분류기들을 활용하여, CLIP 모델이 ImageNet 모델보다 항상 더 잘 校정되지는 않으며, 훈련 데이터 분포에 강하게 의존하고, 校정 이후 분포 변화 상황에서도 상대적으로 신뢰할 수 있는 불확실성 추정을 유지함을 규명한다. 이는 이전 연구에서 제기된 CLIP의 본질적 강건성에 대한 가정을 도전한다.

ABSTRACT

Contrastive Language-Image Pre-training (CLIP) models have demonstrated remarkable generalization capabilities across multiple challenging distribution shifts. However, there is still much to be explored in terms of their robustness to the variations of specific visual factors. In real-world applications, reliable and safe systems must consider other safety objectives beyond classification accuracy, such as predictive uncertainty. Yet, the effectiveness of CLIP models on such safety-related features is less-explored. Driven by the above, this work comprehensively investigates the safety objectives of CLIP models, specifically focusing on three key properties: resilience to visual factor variations, calibrated uncertainty estimations, and the ability to detect anomalous inputs. To this end, we study 83 CLIP models and 127 ImageNet classifiers. They are diverse in architecture, (pre)training distribution and training strategies. We consider 10 visual factors (e.g., shape and pattern), 5 types of out-of-distribution data, and 8 natural and challenging test conditions with different shift types, such as texture, style, and perturbation shifts. Our study has unveiled several previously unknown insights into CLIP models. For instance, they are not consistently more calibrated than other ImageNet models, which contradicts existing findings. Additionally, our analysis underscores the significance of training source design by showcasing its profound influence on the three safety-related properties. We believe our comprehensive study can shed light on and help guide the development of more robust and reliable CLIP models.

연구 동기 및 목표

  • 특정 시각적 요인(예: 자세, 조명, 가림) 변화에 대한 CLIP 모델의 강건성을 조사하기 위해.
  • 다양한 분포 외(OOD) 벤치마크에서 CLIP 모델의 분포 외 입력 탐지 성능을 평가하기 위해.
  • 분포 변화 상황에서 CLIP 모델이 잘 校정된 예측 불확실성 추정을 제공하는지 평가하기 위해.
  • 훈련 데이터 분포와 모델 아키텍처가 이러한 안전성 관련 성질에 미치는 영향을 검토하기 위해.
  • CLIP의 校정 및 강건성에서의 우월성에 대한 이전의 모순된 주장들을 도전하고 명확히 하기 위해.

제안 방법

  • 다양한 비전 인코더(예: ResNet, ViT), 훈련 소스(WIT, LAION), 데이터셋 크기를 가진 83개의 CLIP 모델을 평가하였다.
  • 성능 및 신뢰성 기준을 확립하기 위해 127개의 ImageNet 미세조정 모델과 비교하였다.
  • ImageNet-X 데이터셋에서 유래한 10가지 요인(예: 자세, 조명, 배경)을 활용해 시각적 요인 강건성을 평가하였다.
  • ImageNet을 내재 분포 집합으로 사용해 5개의 OOD 벤치마크(SUN, Places-OOD 등)에서 OOD 탐지를 테스트하였다.
  • 텍스처, 스타일, 편향 변화와 같은 표준적인 분포 이탈 유형을 활용해 예측 불확실성 추정을 평가하였다.
  • 불확실성 校정을 위해 온도 스케일링을 적용하고, 프롬프트 영향 분석을 위해 강력한 선형 회귀를 사용하였다.

실험 결과

연구 질문

  • RQ1CLIP 성능은 다양한 시각적 요인 변화에서 어떻게 변할까? 그리고 표준 ImageNet 분류기보다 일관되게 뛰어나게 되는가?
  • RQ2CLIP 모델은 분포 외 입력으로의 일반화 능력이 어느 정도인가? 이는 다양한 훈련 소스와 모델 아키텍처 간에 어떻게 달라지는가?
  • RQ3CLIP 모델은 표준 ImageNet 모델보다 더 잘 校정되는가? 이는 훈련 데이터 분포에 따라 어떻게 달라지는가?
  • RQ4테스트 시점의 프롬프트 선택은 CLIP의 분류 정확도, OOD 탐지 및 불확실성 校정에 어떤 영향을 미치는가?
  • RQ5훈련 데이터 분포와 양이 CLIP의 안전성 관련 성질에 미치는 상대적 영향은 어떠한가?

주요 결과

  • CLIP 모델이 표준 ImageNet 모델보다 항상 더 잘 校정된다는 주장은 사실이 아니며, 이는 훈련 분포가 校정에 미치는 영향을 드러낸다.
  • CLIP 모델은 색상, 배경 등 10가지 요인 중 6가지에 대해 뛰어난 강건성을 보이지만, 자세 변화에는 덜 강건하여 아키텍처 및 분포 의존성이 드러난다.
  • 훈련 소스 설계가 모든 세 가지 안전성 성질에 막대한 영향을 미치며, WIT에서 훈련된 모델는 LAION에서 훈련된 모델보다 더 강력한 OOD 탐지 및 강건성을 보이며, 정확도가 유사하더라도 그렇다.
  • 내재 분포(ID)에서의 온도 스케일링을 통한 校정 이후, CLIP 모델은 분포 변화 상황에서도 상당히 좋은 불확실성 추정을 유지하며, 비-CLIP 모델보다 이 분야에서 뛰어난 성능을 보인다.
  • 인퍼런스 시 80개의 프롬프트를 사용하는 것보다 1개 또는 5개의 프롬프트를 사용할 경우 OOD 탐지 및 校정 성능이 향상됨을 확인하여, 프롬프트 설계가 신뢰성에 핵심적임을 시사한다.
  • CLIP 모델의 형태 편향은 ImageNet에서의 미세조정 이후 감소하여 표준 ImageNet 모델과 유사해지며, 이는 적응 과정이 유도적 편향을 감소시킴을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.