Skip to main content
QUICK REVIEW

[論文レビュー] Don't Stop Learning: Towards Continual Learning for the CLIP Model

Yuxuan Ding, Lingqiao Liu|arXiv (Cornell University)|Jul 19, 2022
Domain Adaptation and Few-Shot Learning被引用数 11
ひとこと要約

本稿では、CLIPモデル向けの継続的学習手法VR-LwFを提案する。この手法は、ランダムに生成された仮想クラスの予測を蒸留することで、微調整中の災難的忘却を軽減する。本手法は、ゼロショット性能および画像・テキストマッチング性能を維持しつつ、微調整精度を向上させ、LwF や RKR といった既存の継続的学習手法の直接的適用よりも、ゼロショットおよびリtrievalベンチマークで優れた性能を発揮する。

ABSTRACT

The Contrastive Language-Image Pre-training (CLIP) Model is a recently proposed large-scale pre-train model which attracts increasing attention in the computer vision community. Benefiting from its gigantic image-text training set, the CLIP model has learned outstanding capabilities in zero-shot learning and image-text matching. To boost the recognition performance of CLIP on some target visual concepts, it is often desirable to further update the CLIP model by fine-tuning some classes-of-interest on extra training data. This operation, however, raises an important concern: will the update hurt the zero-shot learning or image-text matching capability of the CLIP, i.e., the catastrophic forgetting issue? If yes, could existing continual learning algorithms be adapted to alleviate the risk of catastrophic forgetting? To answer these questions, this work conducts a systemic study on the continual learning issue of the CLIP model. We construct evaluation protocols to measure the impact of fine-tuning updates and explore different ways to upgrade existing continual learning methods to mitigate the forgetting issue of the CLIP model. Our study reveals the particular challenges of CLIP continual learning problem and lays a foundation for further researches. Moreover, we propose a new algorithm, dubbed Learning without Forgetting via Replayed Vocabulary (VR-LwF), which shows exact effectiveness for alleviating the forgetting issue of the CLIP model.

研究の動機と目的

  • 特定の視覚的カテゴリにCLIPを微調整することにより、ゼロショットおよび画像・テキストマッチング能力が災難的忘却を起こすかどうかを調査すること。
  • 既存の継続的学習アルゴリズム(LwF, GeoDL, IMM, RKR)がCLIPモデルの継続的学習設定に適応可能かどうかを評価すること。
  • CLIP向けに特化した新しい継続的学習手法を設計・検証し、事前学習済みの能力を維持しながら効果的な微調整を可能にすること。
  • CLIPにおける継続的学習のための体系的評価プロトコルを確立し、忘却と性能向上の再現可能なベンチマークを可能にすること。

提案手法

  • VR-LwFは、微調整中に合成クラスを表すためにランダムに生成された仮想文(再現語彙)を用いて知識蒸留を実施する。
  • モデルは、新しいデータの更新前後でこれらの仮想クラスに対する予測ログィットが一貫しているように訓練され、表現空間における安定性が保証される。
  • 蒸留は更新されたクラスではなく再現語彙に対して行われるため、一般化性能が向上し、忘却が軽減される。
  • 本手法は、OST(ワンストリーム)、MST(マルチストリーム)、および COCO/Flickr リtrieval タスクの複数の継続的学習シナリオで評価される。
  • アブレーションスタディでは、ランダムサンプリングと自然なキャプションの再現を比較し、サンプリング長さと再現サイズを変化させて、耐性および効率性を評価する。
  • 評価には標準的な指標が用いられる:UT-Acc(タスク精度)、ZS-Acc(ゼロショット精度)、Bwt(バックワード転送)、TR@1/IR@1(リtrieval性能)。

実験結果

リサーチクエスチョン

  • RQ1新しい視覚的カテゴリにCLIPを微調整すると、ゼロショットおよび画像・テキストマッチング能力が災難的忘却を起こすか?
  • RQ2LwF, GeoDL, IMM, RKR といった既存の継続的学習手法が、CLIPモデルの継続的学習設定に効果的に適応可能か?
  • RQ3蒸留のターゲットとして選択するもの(更新済みクラス vs. 再現された仮想クラス)の選択が、CLIPにおける性能と忘却に与える影響は?
  • RQ4異なる再現戦略(ランダムサンプリング vs. キャプションの再現)およびハイパーパramータ(サンプリング長さ、再現サイズ)が、CLIPの継続的学習性能に与える影響は?

主な発見

  • マルチセッション設定において、CLIPは微調整後に顕著な災難的忘却を経験し、ゼロショット精度が元のモデルの62.62%から39.80%に低下する。
  • 既存の継続的学習手法(例:LwF拡張)の直接的適用は忘却を軽減するが、微調整性能を犠牲にし、OSTではUT-Accが72.82%、ZS-Accが58.75%にとどまる。
  • VR-LwFはOSTで74.41%のUT-Accおよび62.03%のZS-Accを達成し、微調整性能およびゼロショット性能の両面でLwF拡張を上回る。
  • マルチセッション設定(MST)では、VR-LwF-WMが61.13%のA-Accおよび68.32%のTR@1を達成し、複数データセット間での高い安定性と転送性を示す。
  • OSTではキャプション再現がランダムサンプリングよりわずかに優れるが、MSTでは逆に劣るため、文法が性能の主な要因ではないと示唆される。
  • 再現サイズ(Ks)を50から400に増加させるとA-Accがわずかに向上するが、トレーニングコストが増加し、Ks=200を超えると収益の逓減が顕著になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。