Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification

Sravanti Addepalli, Ashish Ramayee Asokan|arXiv (Cornell University)|Oct 12, 2023
Safety Warnings and SignagePsychology被引用数 3
ひとこと要約

この論文では、ブラックボックス設定下で視覚言語モデル(VLM)を学生モデルに distillation する際に、画像とテキストの両方の埋め込みを事前にアライメントすることで、分布外(OOD)一般化を向上させる VL2V-ADiP の手法を提案する。学生モデルの視覚特徴をVLMの画像およびテキスト埋め込みとアライメントさせた後、distillation を行うことで、OOD性能を著しく向上させるとともに、学生モデルの事前学習済み特徴を保持し、ドメイン一般化ベンチマークで最先端の結果を達成した。

ABSTRACT

Vision-Language Models (VLMs) such as CLIP are trained on large amounts of image-text pairs, resulting in remarkable generalization across several data distributions. However, in several cases, their expensive training and data collection/curation costs do not justify the end application. This motivates a vendor-client paradigm, where a vendor trains a large-scale VLM and grants only input-output access to clients on a pay-per-query basis in a black-box setting. The client aims to minimize inference cost by distilling the VLM to a student model using the limited available task-specific data, and further deploying this student model in the downstream application. While naive distillation largely improves the In-Domain (ID) accuracy of the student, it fails to transfer the superior out-of-distribution (OOD) generalization of the VLM teacher using the limited available labeled images. To mitigate this, we propose Vision-Language to Vision - Align, Distill, Predict (VL2V-ADiP), which first aligns the vision and language modalities of the teacher model with the vision modality of a pre-trained student model, and further distills the aligned VLM representations to the student. This maximally retains the pre-trained features of the student, while also incorporating the rich representations of the VLM image encoder and the superior generalization of the text embeddings. The proposed approach achieves state-of-the-art results on the standard Domain Generalization benchmarks in a black-box teacher setting as well as a white-box setting where the weights of the VLM are accessible.

研究の動機と目的

  • ブラックボックスのVLMから蒸留される学生モデルが、優れた一般化能力を有するにもかかわらず、OOD一般化が不十分であるという課題に対処すること。
  • ラベル付き画像のみが利用可能な状況で、VLMの頑健性を単一モodalな学生モデルに効果的に転送する方法を調査すること。
  • VLMの重みや完全なアーキテクチャにアクセスできない状況で、VLMの画像およびテキスト埋め込みの両方を活用する手法を開発すること。
  • 学生モデルの事前学習済み特徴を保持するとともに、推論コストを最小限に抑えながら、蒸留後の学生モデルのOOD性能を向上させること。
  • ブラックボックスおよびフルアクセス設定の両方で、ドメイン一般化において最先端の性能を示すこと。

提案手法

  • VLMから単一モダリティの学生モデルへの蒸留を目的とした三段階フレームワーク「VL2V-ADiP」を提案:視覚言語から視覚へのアライメント、蒸留、予測。
  • まず、対照的アライメント目的関数を用いて、学生モデルの視覚特徴をVLMの画像およびテキスト埋め込みとアライメントする。
  • 次に、学生特徴とVLMの画像およびテキスト埋め込みの間の重み付きコサイン類似度損失を用いて、アライメント済みのVLM埋め込みを学生モデルに蒸留する。
  • 損失関数は両モodalの監督を統合する:$\mathcal{L} = -\frac{1}{2n}\sum_{i=1}^{n}\big{(}(1-\lambda)\cdot\cos(\mathbf{PF}^{s}_{x_{i}},\mathbf{T}_{y_{i}}) + \lambda\cdot\cos(\mathbf{PF}^{s}_{x_{i}},\mathbf{I}^{t}_{x_{i}})\big{)}$、ここで $\lambda = 0.5$ がデフォルト値。
  • VLMの重みや内部パラメータにアクセスせず、ImageNet-1Kで事前学習された学生モデルを初期化し、VLMの完全な微調整を回避する。
  • VLMのテキスト埋め込みを、追加の微調整なしに学生モデルの分類器として直接利用可能にし、OODの頑健性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ラベル付き画像のみが利用可能な状況で、視覚言語モデルの優れたOOD一般化能力が、単一モダリティの学生モデルに効果的に転送可能か。
  • RQ2画像埋め込みのみと比較して、VLMのテキスト埋め込みがOOD頑健性を向上させる役割を果たすか。
  • RQ3限られたデータ下で、学生モデルとブラックボックスVLM間の特徴アライメントが、蒸留性能にどのように寄与するか。
  • RQ4蒸留段階で画像およびテキスト埋め込みの監督をバランスよく融合させることで、画像のみの監督に比べてOOD一般化が向上するか。
  • RQ5VLMにアクセスできない状況で、自己蒸留技術がOOD一般化を向上させるか、また、VLMからの直接蒸留と比較して性能はいかが。

主な発見

  • Office-Home データセットでは、VL2V-ADiP がドメイン間で平均OOD精度81.89%を達成し、SAGM(79.60%)やDART(77.29%)を上回る最先端の性能を示した。
  • PACS データセットでは、VL2V-ADiP が平均OOD精度96.68%を達成し、次善の手法(SAGM 94.30%)を上回り、ERM微調整(91.35%)を著しく上回った。
  • DomainNet では、CLIP初期化下でVL2V-ADiP が平均OOD精度62.79%を達成し、SAGM(59.05%)やDART(59.32%)を上回り、顕著なドメインシフト領域でも高い性能を示した。
  • 特にドメインシフトが最大の領域(例:ClipArt(OH)、Infograph(DN)、Painting(OH))で、最も顕著な性能向上を示しており、VLMの頑健性が効果的に転送されていることを示した。
  • アブレーションスタディにより、画像およびテキスト埋め込み損失の等重み($\lambda = 0.5$)が、データセット全体で安定した性能をもたらし、ハイパーパramータの感度が最小限であることが確認された。
  • VLMがブラックボックス推論のみでアクセス可能な状況でも、VL2V-ADiP は強力な性能を維持しており、ベンダー・クライアント環境における実用的展開に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。