[論文レビュー] Retrieval-Enhanced Visual Prompt Learning for Few-shot Classification
本稿では、リミニャスド・ビジョナル・プロンプト・ラーニングフレームワークRePromptを提案する。このフレームワークは、プロンプトチューニングを支援するために、関連するトレーニング埋め込みをキャッシュおよび検索することで、少サンプル画像分類を向上させる。入力、中間層、推論の複数段階に検索を統合することで、11のビジョンデータセットおよび4つのドメイン一般化ベンチマークで最先端の性能を達成し、特に低ショットおよび高ドメインギャップの状況で優れた結果を示す。
The Contrastive Language-Image Pretraining (CLIP) model has been widely used in various downstream vision tasks. The few-shot learning paradigm has been widely adopted to augment its capacity for these tasks. However, current paradigms may struggle with fine-grained classification, such as satellite image recognition, due to widening domain gaps. To address this limitation, we propose retrieval-enhanced visual prompt learning (RePrompt), which introduces retrieval mechanisms to cache and reuse the knowledge of downstream tasks. RePrompt constructs a retrieval database from either training examples or external data if available, and uses a retrieval mechanism to enhance multiple stages of a simple prompt learning baseline, thus narrowing the domain gap. During inference, our enhanced model can reference similar samples brought by retrieval to make more accurate predictions. A detailed analysis reveals that retrieval helps to improve the distribution of late features, thus, improving generalization for downstream tasks. Reprompt attains state-of-the-art performance on a wide range of vision datasets, including 11 image datasets, 3 video datasets, 1 multi-view dataset, and 4 domain generalization benchmarks.
研究の動機と目的
- クラス内視覚的ばらつきが大きい状況において、プロンプトラーニングの一般化性能が低い問題に対処すること。
- CLIPのようなフリーズドビジョナル・ランゲージモデルを低リソースの下流タスクに適応させるために、固定または学習可能なプロンプトテンプレートの限界を克服すること。
- プロンプトラーニング中に類似例の外部知識を統合することで、ゼロショットおよび少サンプル性能を向上させること。
- 1〜16ショット/クラスでのみ利用可能な場合でも、検索ベースの知識統合により、未観測ドメインへの効果的適応を可能にすること。
- 入力、中間、出力段階に検索を統合した統一フレームワークを設計し、エンドツーエンドのトレーニングガイダンスを提供すること。
提案手法
- 少サンプルトレーニングセットからのフリーズド画像エンコーダー特徴量(キー)と対応するラベルまたは特徴量(値)を用いて、検索データベースを構築する。
- クエリ画像特徴量に基づき、最大内積検索(MIPS)を用いて類似度が最も高いK個のトレーニングサンプルを検索する。
- 2つの戦略を用いて、検索された知識をビジョナル・プロンプト・ラーニングプロセスに統合する:(1) 画像エンコーダーの複数層に検索強化型ビジョナル・プロンプトを挿入し、(2) 分類スコアを精緻化するためにパラメトリックk-NNアダプタを適用する。
- 検索結果に基づく微分可能で事前分布に依存する損失関数を用い、エンドツーエンドでモデルをトレーニングする。この損失関数は、検索の影響とモデルの信頼度のバランスを取る。
- 検索エンコーダーとしてCLIPのViT-B/16を用いる($e_R$)。これは、TimmのViT-B/16よりも検索品質が優れている。
- ノイズを避けるために、検索プロンプト挿入の深さ(J)および温度ハイパーパrameter($\gamma$)を動的に調整する。
実験結果
リサーチクエスチョン
- RQ1ドメインギャップが拡大する状況において、類似トレーニングサンプルの検索が、少サンプルビジョナル・プロンプト・ラーニングを向上させることができるか?
- RQ2プロンプトラーニングの異なる段階(入力、中間、出力)に検索を統合すると、モデル性能にどのように影響するか?
- RQ3知識の獲得とノイズのバランスを取るために、最適な挿入深さと温度($\gamma$)は何か?
- RQ4分布外および細分化されたデータセットにおいて、検索ベースのプロンプトラーニングは、標準的なプロンプトラーニングよりも一般化性能が優れているか?
- RQ5クラス内視覚的ばらつきが、検索拡張型プロンプトラーニングの有効性にどのように影響するか?
主な発見
- RePromptは、FGVC Aircraft、ImageNet、Oxford Petsなど、挑戦的なベンチマークも含む11の少サンプルビジョンデータセットで最先端の性能を達成し、Oxford Petsでは16ショットで最大94.58%の正確度を達成した。
- ImageNetでは、最初の3層に検索強化型プロンプトを挿入したRePromptが74.57%の正確度を達成し、ベースラインのCoOPやVLPTを上回った。
- ドメイン一般化ベンチマーク(ImageNet-Sketch、ImageNet-A、ImageNet-R、ImageNetV2)においても、RePromptは優れたロバストネスと一般化性能を示し、未観測ドメインにおける有効性を確認した。
- 最適な挿入深さ(J)はデータセットによって異なる:FGVC Aircraftでは5層、ImageNetでは3層、Oxford Petsでは6層であり、中程度の検索統合が最も効果的であることを示唆している。
- $\gamma$の値を低くすると(検索の影響を強くすると)、性能が向上し、適切にチューニングされた場合、検索拡張が一貫して有益であることが示された。
- CLIPのViT-B/16を検索エンコーダー($e_R$)として使用すると、特に「ベロア織」のような難しいサンプルにおいて、Timmの教師ありViT-B/16よりも優れた結果が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。