Skip to main content
QUICK REVIEW

[論文レビュー] ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free Domain Adaptation

Xuefeng Hu, Ke Zhang|arXiv (Cornell University)|Aug 4, 2023
Domain Adaptation and Few-Shot LearningComputer Science被引用数 3
ひとこと要約

ReCLIPは、CLIPのようなビジョン・ランゲージモデル向けに、ソースデータやラベルなしでドメイン適応を実現する手法を提案する。学習された射影空間を用いて視覚的・言語的埋め込みを再配列し、ラベル伝播により高信頼度の偽ラベルを生成。その後、クロスモダリティ自己学習を適用して、エンコーダーを反復的に最適化し、22のベンチマークでゼロショット精度を69.83%から74.94%まで向上させる。

ABSTRACT

Large-scale Pre-Training Vision-Language Model such as CLIP has demonstrated outstanding performance in zero-shot classification, e.g. achieving 76.3% top-1 accuracy on ImageNet without seeing any example, which leads to potential benefits to many tasks that have no labeled data. However, while applying CLIP to a downstream target domain, the presence of visual and text domain gaps and cross-modality misalignment can greatly impact the model performance. To address such challenges, we propose ReCLIP, the first source-free domain adaptation method for vision-language models, which does not require any source data or target labeled data. ReCLIP first learns a projection space to mitigate the misaligned visual-text embeddings and learns pseudo labels, and then deploys cross-modality self-training with the pseudo labels, to update visual and text encoders, refine labels and reduce domain gaps and misalignments iteratively. With extensive experiments, we demonstrate ReCLIP reduces the average error rate of CLIP from 30.17% to 25.06% on 22 image classification benchmarks. Code available at https://github.com/michiganleon/ReCLIP_WACV.

研究の動機と目的

  • 視覚的・言語的ドメインギャップやクロスモダリティの不整合によるCLIPの下流ドメインにおける性能低下を是正すること。
  • ラベル付きのターゲットデータやソースデータを必要とする従来の領域適応手法の限界を克服すること。
  • ソースデータやターゲットラベルにアクセスできない状況下でも安定的かつ効果的なビジョン・ランゲージモデル向けソースフリー適応フレームワークを構築すること。
  • 偽ラベル付けと自己学習を通じて、視覚的および言語的エンコーダーを共同で最適化することでゼロショット一般化性能を向上させること。
  • 1回の適応で十分な効果を得られるよう、事前学習済みCLIPモデルのみを用いて、ラベルなしのターゲットデータに対して効率的な一回限りの適応を可能とすること。

提案手法

  • 視覚的・言語的埋め込みから冗長でクラスに依存しない特徴を除去するための射影空間を学習し、不整合を低減する。
  • 局所的な近傍構造に基づいて、射影空間上でラベル伝播を実行し、正確な偽ラベルを生成する。
  • 高信頼度の偽ラベルを用いてクロスモダリティ自己学習を実施し、視覚的および言語的エンコーダーを同時に更新する。
  • 学習を2つの並列なコンポONENTに分離:一方では言語エンコーダーを微調整し、視覚エンコーダーを固定する。逆も同様。
  • 両方のブランチ間で偽ラベルを共有することで、適応プロセスの安定性を高め、一貫性を向上させる。
  • CLIPにおける複数のテンプレート拡張テキスト埋め込みを用いることで、テキスト表現の多様性と耐性を強化する。

実験結果

リサーチクエスチョン

  • RQ1ソースデータやラベルなしのターゲットデータにアクセスできない状況でも、CLIPのゼロショット性能を向上させることは可能か?
  • RQ2射影空間は、視覚的・言語的埋め込みの不整合やドメインギャップを低減するのにどの程度有効か?
  • RQ3射影空間上でラベル伝播を適用することで、直接クラスタリングやk-NN手法に比べて信頼性の高い偽ラベルが得られるか?
  • RQ4共有された偽ラベルを用いたクロスモダリティ自己学習は、ソースフリー環境下で適応を安定化・向上させられるか?
  • RQ5ReCLIPフレームワークは、さまざまなビジョン・ランゲージモデルやアーキテクチャに一般化可能か?

主な発見

  • ReCLIPは、22の画像分類ベンチマークでCLIPの平均トップ-1精度を69.83%から74.94%まで向上させた。
  • 細分化されたデータセット(Birdsnap や RESISC45)において顕著な向上を示し、テキスト埋め込みの質が重要な分野で顕著な効果を発揮した。
  • 射影空間上でのラベル伝播(P₂)が最も高い向上をもたらし、k-NN やクラスタリングベースラインを上回った。
  • ReCLIPは強力な一般化性能を示し、SLIP や DeCLIP、さまざまなCLIPバージョンを含む、異なるアーキテクチャでも性能向上を達成した。
  • 適応は効率的で、1つのV100 GPU上で1ターゲットドメインあたり0.5~5 GPU時間で完了した。
  • アブレーションスタディの結果、視覚的および言語的適応ブランチ間での偽ラベル共有が、安定性と性能の向上に顕著な寄与を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。