[論文レビュー] Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
本稿では、自己教師あり報酬モデルとしてCLIPを用い、エントロピー最小化による過学習を回避するためのテスト時適応(TTA)手法である強化学習によるCLIPフィードバック(RLCF)を提案する。RLCFは、報酬の期待値を最大化する強化学習により、CLIPスコアを動的ベースラインとともに最適化することで、最小限の監督のもとで画像分類、リtrieval、キャプション生成のタスクにおいて顕著なゼロショット一般化性能の向上を達成する。
One fascinating aspect of pre-trained vision-language models~(VLMs) learning under language supervision is their impressive zero-shot generalization capability. However, this ability is hindered by distribution shifts between the training and testing data. Previous test time adaptation~(TTA) methods for VLMs in zero-shot classification rely on minimizing the entropy of model outputs, tending to be stuck in incorrect model predictions. In this work, we propose TTA with feedback to rectify the model output and prevent the model from becoming blindly confident. Specifically, a CLIP model is adopted as the reward model during TTA and provides feedback for the VLM. Given a single test sample, the VLM is forced to maximize the CLIP reward between the input and sampled results from the VLM output distribution. The proposed extit{reinforcement learning with CLIP feedback~(RLCF)} framework is highly flexible and universal. Beyond the classification task, with task-specific sampling strategies and a proper reward baseline choice, RLCF can be easily extended to not only discrimination tasks like retrieval but also generalization tasks like image captioning, improving the zero-shot generalization capacity of VLMs. According to the characteristics of these VL tasks, we build different fully TTA pipelines with RLCF to improve the zero-shot generalization ability of various VLMs. Extensive experiments along with promising empirical results demonstrate the effectiveness of RLCF. The code is available at https://github.com/mzhaoshuai/RLCF.
研究の動機と目的
- 視覚言語モデルにおけるエントロピー最小化に起因する過学習を解消すること。
- 学習データや人間のアノテーションにアクセスできない状況下でも、推論時にモデル出力をタスクの目的に一致させること。
- マルチモーダルタスクに適した柔軟でスケーラブルなフィードバックメカニズムを、CLIPを報酬モデルとして用いて開発すること。
- 画像分類、リtrieval、キャプション生成などの視覚言語タスクにおけるゼロショットおよびクロスドメイン性能の向上を図ること。
- シンプルで学習可能なベースラインを用いたCLIPベースの報酬設計が、標準的なエントロピー最小化を上回ることを示すこと。
提案手法
- テスト時適応中にフィードバックを提供するために、CLIPを報酬モデルとして用い、画像-テキストペアの類似度に基づいてスコアを割り当てる。
- 動的ベースラインを採用:サンプルされた候補群のCLIPスコアの平均値であり、学習の安定化とアライメントの向上に寄与する。
- 推論中に期待されるCLIP報酬を最大化するために、REINFORCEアルゴリズムと方策勾配更新を適用する。
- タスク固有のサンプリング戦略を採用:分類およびリtrievalにはトップ-Kサンプリング、キャプション生成にはビームサーチを用いる。
- 複数のテストサンプルにわたる知識を保持するためのモーメンタムバッファを導入し、時間経過に伴う一般化性能の向上を図る。
- 複数のCLIPモデルを統合してより強固な報酬アンサンブルを形成するための統合をサポートする。
実験結果
リサーチクエスチョン
- RQ1CLIPは、視覚言語モデルにおけるテスト時適応に有効な自己教師あり報酬モデルとして機能できるか?
- RQ2エントロピー最小化と比較して、CLIPスコアを報酬信号として用いることで、TTAにおける過学習が抑制されるか?
- RQ3RLCFは、多様な視覚言語タスクにおいてゼロショットおよびクロスドメイン性能をどれほど向上させるか?
- RQ4平均CLIPスコアに基づくシンプルで学習可能なベースラインが、固定または複雑な報酬ベースラインを上回るか?
- RQ5モーメンタムバッファは、連続的なテスト時適応において一般化性能をどの程度向上させるか?
主な発見
- RLCFは、ImageNet-A、ImageNet-V2、ImageNet-RなどのOODベンチマークにおいて、エントロピー最小化に基づくTTAを上回る画像分類精度の向上を示した。
- ゼロショット画像-テキストリtrievalでは、MS-COCOからFlickr30Kへの転移において、CIDErスコアが最大5.7%向上し、顕著なゼロショット一般化性能を示した。
- クロスドメイン画像キャプション生成では、NoCapsでCIDErスコアが最大9.2ポイント、Flickr30Kで8.5ポイント向上し、1つのテストサンプルでも高い性能を発揮した。
- CLIPCapにRLCFを適用した場合、ベースライン比でCIDErスコアが7.8ポイント向上し、高品質なキャプション生成モデルでも本手法の有効性が顕著に示された。
- モーメンタムバッファは、全タスクにわたり一貫して性能向上をもたらし、複数のテストサンプルにわたる知識の保持が有効であることが示された。
- よりシンプルなサンプリング戦略を採用するRLCF-Sは、多くの場合でRLCFと同等の性能を示し、ロバスト性と実用性の高さを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。