[論文レビュー] Domain-Unified Prompt Representations for Source-Free Domain Generalization
本稿では、視覚言語モデル(CLIP)から得られるドメイン統一型プロンプト表現を用いて、トレーニング中にソースドメインデータを必要としない、ソースフリーのドメイン一般化手法を提案する。広範なドメインバンクから多様なテキストプロンプトを生成し、ドメイン固有の情報を除去しながらクラス固有の特徴を保持する学習可能なアダプタ(CAE)を適用することで、ドメイン不変の表現に統一する。この手法により、標準ベンチマークで最先端の性能を達成するとともに、トレーニング時にソースデータを一切使用しないオープンワールドドメインにおいても顕著に優れた性能を発揮する。
Domain generalization (DG), aiming to make models work on unseen domains, is a surefire way toward general artificial intelligence. Limited by the scale and diversity of current DG datasets, it is difficult for existing methods to scale to diverse domains in open-world scenarios (e.g., science fiction and pixelate style). Therefore, the source-free domain generalization (SFDG) task is necessary and challenging. To address this issue, we propose an approach based on large-scale vision-language pretraining models (e.g., CLIP), which exploits the extensive domain information embedded in it. The proposed scheme generates diverse prompts from a domain bank that contains many more diverse domains than existing DG datasets. Furthermore, our method yields domain-unified representations from these prompts, thus being able to cope with samples from open-world domains. Extensive experiments on mainstream DG datasets, namely PACS, VLCS, OfficeHome, and DomainNet, show that the proposed method achieves competitive performance compared to state-of-the-art (SOTA) DG methods that require source domain data for training. Besides, we collect a small datasets consists of two domains to evaluate the open-world domain generalization ability of the proposed method. The source code and the dataset will be made publicly available at https://github.com/muse1998/Source-Free-Domain-Generalization
研究の動機と目的
- ソースドメインデータが入手不可能なオープンワールドのシナリオにおけるドメイン一般化の課題に対処すること。
- 実世界の応用においてしばしば収集が不切実な大規模なソースドメイン画像データへの依存を低減すること。
- ピクセル化やアートスタイルなど、まれなまたは装飾的なスタイルを含む未観測ドメインに対しても効果的に一般化できる手法の開発。
- 視覚言語モデルに事前に統合された豊富なドメイン知識を活用してゼロショットドメイン一般化を実現すること。
提案手法
- PACS、VLCS、OfficeHome、DomainNetといった複数の既存データセットから得られる多様なテキストプロンプトを含むドメインバンクを構築し、広範なドメインを表現する。
- CLIPを用いてこれらのプロンプトをテキスト埋め込みにエンコードし、ドメイン表現学習の基盤を構築する。
- ドメイン固有の情報をフィルタリングしながらクラス固有の特徴を保持する学習可能なクロスアテンションエンコーダー(CAE)を導入し、ドメイン統一型プロンプト表現を生成する。
- CAEの出力に対して平均プーリングを適用し、各クラスごとに1つのドメイン不変表現を生成する。
- ドメイン統一型プロンプト表現をクラスプロトタイプとして用い、ターゲットドメインデータのみでモデルを訓練する。
- CAEの訓練中にクラス固有のクラスタリングとドメイン不変性を促進するためのコントラスト学習目的関数を採用する。
実験結果
リサーチクエスチョン
- RQ1ソースドメイン画像を一切使用せずに、テキストプロンプトからドメイン統一型プロンプト表現を効果的に学習できるか?
- RQ2本手法は、ソースデータを必要とする最先端の手法と比較して、標準ドメイン一般化ベンチマークでどの程度の性能を発揮するか?
- RQ3ピクセル化や幾何学的スタイルなど、トレーニング時に観測されなかった真のオープンワールドドメインに対し、どの程度一般化できるか?
- RQ4大規模かつ多様なドメインバンクの使用が、分布外ドメインに対するロバストネスを向上させるか?
- RQ5CAEモジュールは、ドメイン固有の特徴を効果的にフィルタリングしながら、クラスレベルの意味を保持できるか?
主な発見
- PACSデータセットにおいて、本手法はターゲットドメインデータのみを用いて97.1%の精度を達成し、DPL(フォト:94.9%、スケッチ:90.8%)などのマルチソース最先端手法を上回った。
- OfficeHomeにおいて、本手法はオープンワールドのピクセル化および幾何学的スタイルドメインで95.1%の精度を達成し、ERM(51.5%)およびGroupDRO(52.2%)のベースラインを著しく上回った。
- CAEモジュールは、異なるドメインからのプロンプト表現を共通の中心点の周囲にクラスタリングすることができ、t-SNE可視化によりドメイン不変性学習の有効性が示された。
- 本手法は、PACS、VLCS、OfficeHome、DomainNetの4つの標準DGデータセットすべてで最先端の性能を達成し、統合ドメインバンク設定において平均73.2%の精度を達成した。
- アブレーションスタディの結果、ドメインバンクの拡大がオープンワールドドメインにおける性能向上に寄与することが確認され、より豊富で多様なプロンプトバンクの利点が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。