Skip to main content
QUICK REVIEW

[論文レビュー] A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)

Weijie Tu, Weijian Deng|arXiv (Cornell University)|Feb 12, 2024
Interpreting and Communication in Healthcare被引用数 4
ひとこと要約

本論文は、視覚的要因の変化、分布外(OOD)検出、予測不確実性のキャリブレーションの観点から、CLIPモデルの耐性について包括的な実験的調査を実施している。83体のCLIPモデルと、多様なアーキテクチャーやトレーニングソースを有する127体のImageNet分類器を用いて調査した結果、CLIPモデルはImageNetモデルよりも一貫してキャリブレーションが良いとは限らず、トレーニングデータの分布に強く依存しており、キャリブレーションを施した後は分布シフト下でも比較的信頼性の高い不確実性推定を維持していることが判明した。これは、CLIPモデルに内在する耐性に関する先行仮説に疑問を呈するものである。

ABSTRACT

Contrastive Language-Image Pre-training (CLIP) models have demonstrated remarkable generalization capabilities across multiple challenging distribution shifts. However, there is still much to be explored in terms of their robustness to the variations of specific visual factors. In real-world applications, reliable and safe systems must consider other safety objectives beyond classification accuracy, such as predictive uncertainty. Yet, the effectiveness of CLIP models on such safety-related features is less-explored. Driven by the above, this work comprehensively investigates the safety objectives of CLIP models, specifically focusing on three key properties: resilience to visual factor variations, calibrated uncertainty estimations, and the ability to detect anomalous inputs. To this end, we study 83 CLIP models and 127 ImageNet classifiers. They are diverse in architecture, (pre)training distribution and training strategies. We consider 10 visual factors (e.g., shape and pattern), 5 types of out-of-distribution data, and 8 natural and challenging test conditions with different shift types, such as texture, style, and perturbation shifts. Our study has unveiled several previously unknown insights into CLIP models. For instance, they are not consistently more calibrated than other ImageNet models, which contradicts existing findings. Additionally, our analysis underscores the significance of training source design by showcasing its profound influence on the three safety-related properties. We believe our comprehensive study can shed light on and help guide the development of more robust and reliable CLIP models.

研究の動機と目的

  • 特定の視覚的要因(姿勢、照明、隠蔽など)の変化に対するCLIPモデルの耐性を調査すること。
  • 複数のOODベンチマークを用いて、CLIPモデルの分布外(OOD)入力の検出性能を評価すること。
  • 分布シフト下において、CLIPモデルが適切にキャリブレートされた予測不確実性推定を提供するかどうかを評価すること。
  • トレーニングデータの分布とモデルアーキテクチャが、これらの安全性に重要な特性に与える影響を検討すること。
  • CLIPのキャリブレーションおよび耐性に関する、矛盾する先行主張を検証し、明確化すること。

提案手法

  • 多様なビジョンエンコーダー(例:ResNet, ViT)、トレーニングソース(WIT, LAION)、データセットサイズを有する83体のCLIPモデルを評価した。
  • 性能と信頼性のベースラインを確立するため、127体のImageNetファインチューニング済みモデルと比較した。
  • ImageNet-Xデータセットを用いて、10要因(例:姿勢、照明、背景)を用いて視覚的要因の耐性を評価した。
  • ImageNetをインディストリビューション(ID)セットとして用い、SUNやPlaces-OODなどの5つのOODベンチマークでOOD検出をテストした。
  • テクスチャ、スタイル、摂動シフトの代表的なシフトタイプを用いて、予測不確実性を評価した。
  • 不確実性キャリブレーションに温度スケーリングを適用し、プロンプト効果の分析に頑健な線形回帰を用いた。

実験結果

リサーチクエスチョン

  • RQ1CLIPモデルの性能は、異なる視覚的要因の変化に対してどのように変化するか。また、標準的なImageNet分類器よりも一貫して優れているか。
  • RQ2CLIPモデルは、分布外(OOD)入力にどの程度一般化できるか。これは、異なるトレーニングソースやモデルアーキテクチャに依存するか。
  • RQ3CLIPモデルは標準的なImageNetモデルよりもキャリブレーションが優れているか。これは、トレーニングデータの分布に応じてどのように変化するか。
  • RQ4推論時のプロンプト選択が、CLIPの分類精度、OOD検出、不確実性キャリブレーションにどのように影響するか。
  • RQ5トレーニングデータの分布と量が、CLIPの安全性関連特性に与える相対的影響は何か。

主な発見

  • CLIPモデルは、標準的なImageNetモデルよりも一貫してキャリブレーションが良いとは限らず、これは先行主張に反するものであり、キャリブレーションにトレーニング分布の影響が顕著に現れていることを示している。
  • CLIPモデルは10要因のうち6要因(例:色、背景)に対して優れた耐性を示すが、姿勢の変化に対しては劣っており、アーキテクチャーや分布的要因に依存していることが判明した。
  • トレーニングソースの設計は、すべての3つの安全性特性に顕著な影響を与える。WITでトレーニングされたモデルは、LAIONでトレーニングされたモデルでさえも、同等の精度であっても、OOD検出と耐性が優れている。
  • IDキャリブレーションに温度スケーリングを適用した後、CLIPモデルは分布シフト下でも比較的良い不確実性推定を維持しており、非CLIPモデルに比べて優れた性能を示した。
  • 推論時に80個のプロンプトを使用するのではなく、1つや5つのプロンプトに制限することで、OOD検出とキャリブレーション性能が向上することが示された。これは、信頼性の観点からプロンプト設計が極めて重要であることを示唆している。
  • CLIPモデルはImageNetでファインチューニングを経ることで、形状バイアスが低下し、標準的なImageNetモデルと同等の水準にまで低下する。これは、適応によってインダクティブバイアスが軽減されることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。