Skip to main content
QUICK REVIEW

[論文レビュー] Domain Prompt Learning for Efficiently Adapting CLIP to Unseen Domains

Xin Zhang, Shixiang Gu|arXiv (Cornell University)|Nov 25, 2021
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本稿では、テスト時にドメイン固有の連続プロンプトを生成する軽量なMLPプロンプト生成器を訓練することで、視覚エンコーダーの微調整を伴わずにCLIPを未学習ドメインに効率的に適応する手法であるドメインプロンプト学習(DPL)を提案する。DPLは、PACS、VLCS、OfficeHome、TerraIncognitaといった標準的なDGベンチマークで、微調整なしにゼロショットCLIPの精度を73.7%から79.3%まで向上させ、最小限の計算コストで最先端の性能を達成した。

ABSTRACT

Domain generalization (DG) is a difficult transfer learning problem aiming to learn a generalizable model for unseen domains. Recent foundation models (FMs) are robust to many distribution shifts and, therefore, should substantially improve the performance of DG. In this work, we study generic ways to adopt CLIP, a Visual-Language Foundation Model, for DG problems in image classification. While ERM greatly improves the accuracy with bigger backbones and training datasets using standard DG benchmarks, fine-tuning FMs is not practical in many real-world situations. We propose Domain Prompt Learning (DPL) as a novel approach for domain inference in the form of conditional prompt generation. DPL achieved a significant accuracy improvement with only training a lightweight prompt generator (a three-layer MLP), whose parameter is of equivalent scale to the classification projector in the previous DG literature. Combining \dplshort~with CLIP provides surprising performance, raising the accuracy of zero-shot CLIP from 73.7% to 79.3% on several standard datasets, namely PACS, VLCS, OfficeHome, and TerraIncognita. We hope the simplicity and success of our approach lead to broader adoption and analysis of foundation models in the domain generalization field. Our code is available at https://github.com/shogi880/DPLCLIP.

研究の動機と目的

  • 視覚エンコーダーの微調整を伴わずに、分布シフトに対して頑健なCLIPの特性を活用することで、画像分類におけるドメイン一般化(DG)を解決すること。
  • 標準的な微調整の限界を克服すること。標準的な微調整は、特定のドメインで性能を低下させる可能性があり、計算コストが高くなる。
  • 事前学習済み特徴を保持しながら、未学習ドメインへのゼロショット一般化を向上させる、軽量で効率的な適応手法を開発すること。
  • ドメイン一般化における基礎モデルの微調整の代替手段として、テスト時適応に焦点を当てたプロンプト学習の有効性を検討すること。パrameterの更新を最小限に抑える。
  • プロンプトベースの適応が、標準的な微調整およびゼロショットCLIPを上回ることを、標準的なDGベンチマークで示すこと。

提案手法

  • ドメイン固有の連続プロンプトをテスト時に生成するテスト時プロンプト生成手法として、ドメイン一般化(DPL)を提案する。この手法では、ソースドメイン上で訓練された軽量な3層MLPプロンプト生成器を用いる。
  • プロンプト生成器は入力画像を受け取り、入力の分布に応じて条件付けられたドメイン固有のプロンプトを出力する。その後、そのプロンプトはクラス固有のテキストプロンプトと連結される。
  • 推論時には、画像エンコーダーとテキストエンコーダーを含むCLIPのすべてのコンponentsが固定され、事前学習済み特徴が保持され、安定性が保証される。
  • プロンプト生成器は、ソースドメイン上で対照学習を用いてエンドツーエンドで訓練され、画像特徴と生成されたドメインプロンプトが一致するように学習される。
  • 勾配ベースの最適化が可能となる連続的プロンプト表現を採用することで、ドメイン不変ではあるがドメイン固有のプロンプトパターンを学習可能となる。
  • 入力画像ごとに動的にプロンプトが生成される条件付きプロンプト生成戦略を採用することで、再訓練なしに未学習ドメインへの適応が可能となる。

実験結果

リサーチクエスチョン

  • RQ1プロンプト学習は、視覚エンコーダーの微調整を伴わず、ドメイン一般化において未学習ドメインにCLIPを効果的に適応できるか?
  • RQ2DPLの性能は、複数の標準的なDGベンチマークにおいて、標準的な微調整およびゼロショットCLIPと比較してどうなるか?
  • RQ3ソースドメインで訓練された軽量なプロンプト生成器は、テスト時に未学習のターゲットドメインにうまく一般化できるか?
  • RQ4プロンプトベースの適応は、一部のDG設定で観察される微調整の悪影響を緩和し、性能を安定化させることができるか?
  • RQ5PACS、VLCS、OfficeHome、TerraIncognitaのようなベンチマークにおいて、DPLはゼロショットCLIPの精度をどの程度向上させるか?

主な発見

  • DPLは、PACS、VLCS、OfficeHome、TerraIncognitaベンチマークでゼロショットCLIPの精度を73.7%から79.3%まで向上させ、顕著な性能向上を示した。
  • VLCSデータセットでは、CLIP ViT-B16を用いて84.3%の精度を達成し、微調整されたバックボーンを用いた標準的なERMを上回った。これは、微調整が特定のデータセットで性能を低下させる可能性があることを示している。
  • OfficeHomeおよびVLCSにおいて、バックボーンを固定したERM(経験的リスク最小化)が、微調整されたバックボーンを用いた標準的なERMを上回った。これは、微調整が一般化性能を必ずしも向上させるわけではないことを示している。
  • DPLは、評価されたすべてのデータセットで一貫して性能を向上させ、未学習ドメインへのCLIPの適応において、強固で安定した性能を示した。
  • DPLによる性能向上は顕著であり、TerraIncognitaでは+6.1%、VLCSでは+3.7%の向上を達成したが、訓練に使ったMLPはわずか3層で約10Kパラメータにとどまる。
  • アブレーションスタディの結果、DPLはViT-B16のような大きなバックボーンに対しても有効であり、多様なドメインシフトにわたって良好に一般化されることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。