[論文レビュー] Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language Models
本稿では、視覚言語モデルの継続的学習のための新規な継続的学習手法ZSCLを提案する。ZSCLは、意味的多様性を持つ参照データセット上で初期事前学習モデルからの distillation を行い、重みアンサンブルを用いてパラメータ更新を安定化させることで、ゼロショット転送性能の低下を防止する。ZSCLは、新規なマルチドメインタスクインクリメンタル学習ベンチマークにおいて、先行手法よりも平均精度を9.7%向上させ、最先端の性能を達成した。
Continual learning (CL) can help pre-trained vision-language models efficiently adapt to new or under-trained data distributions without re-training. Nevertheless, during the continual training of the Contrastive Language-Image Pre-training (CLIP) model, we observe that the model's zero-shot transfer ability significantly degrades due to catastrophic forgetting. Existing CL methods can mitigate forgetting by replaying previous data. However, since the CLIP dataset is private, replay methods cannot access the pre-training dataset. In addition, replaying data of previously learned downstream tasks can enhance their performance but comes at the cost of sacrificing zero-shot performance. To address this challenge, we propose a novel method ZSCL to prevent zero-shot transfer degradation in the continual learning of vision-language models in both feature and parameter space. In the feature space, a reference dataset is introduced for distillation between the current and initial models. The reference dataset should have semantic diversity but no need to be labeled, seen in pre-training, or matched image-text pairs. In parameter space, we prevent a large parameter shift by averaging weights during the training. We propose a more challenging Multi-domain Task Incremental Learning (MTIL) benchmark to evaluate different methods, where tasks are from various domains instead of class-separated in a single dataset. Our method outperforms other methods in the traditional class-incremental learning setting and the MTIL by 9.7% average score. Our code locates at https://github.com/Thunderbeee/ZSCL.
研究の動機と目的
- 事前学習済み視覚言語モデルの継続的学習における崩壊的忘却を解決すること、特にゼロショット転送能力の低下を防ぐこと。
- CLIPの事前学習データセットが非公開であるため、リプレイベース手法に制限が生じる問題を克服すること。
- 段階的学習中に特徴空間の知識とパラメータの安定性の両方を維持する手法を開発すること。
- 一般化性能と耐性をよりよく評価できるよう、多様なドメイン(例:料理、車両、風景)からのタスクを含む、より挑戦的なマルチドメインタスクインクリメンタル学習(MTIL)ベンチマークを導入すること。
- 特にゼロショット一般化性能を高めるために、異なる学習順序やタスク分布に対しても強固な性能を発揮すること。
提案手法
- ラベルなしでペアド画像・テキストデータを含まない意味的多様性を持つ参照データセットを導入し、特徴空間におけるdistillationに用いる。
- 現在のファインチューニング済みモデルではなく、元の事前学習済みCLIPモデルを教師モデルとして用いる。
- 特徴空間の類似度の相対関係を維持するように知識蒸留損失を適用し、特徴空間のずれを最小限に抑える。
- 学習段階全体にわたる重みアンサンブル戦略を実装し、大きなパラメータの変化を防ぎ、初期モデルとファインチューニング済みモデルの重みの有効な補間を実現する。
- 特徴空間の蒸留とパラメータ空間の正則化を統合し、表現空間とモデル重み空間の両方における忘却を同時に緩和する。
- 一般化性能と耐性をテストできるよう、多様なドメイン(例:料理、車両、風景)からのタスクを含むマルチドメインタスクインクリメンタル学習(MTIL)ベンチマークを設計する。
実験結果
リサーチクエスチョン
- RQ1事前学習データセットが入手不能な状況下でも、視覚言語モデルの継続的学習におけるゼロショット転送の劣化を防げるか?
- RQ2ラベルなしで多様な参照データセットを用いて、初期事前学習モデルからの知識蒸留がゼロショット性能の維持にどの程度有効か?
- RQ3重みアンサンブルによるパラメータ空間の正則化は、継続的視覚言語学習における安定性と一般化性能を向上させるか?
- RQ4本手法は、現実的で挑戦的な学習順序やマルチドメインタスクシーケンス下でも効果を発揮するか?
- RQ5MTILのような新規ベンチマークは、視覚言語モデルの継続的学習手法の耐性と一般化性能をよりよく評価できるか?
主な発見
- 提案されたマルチドメインタスクインクリメンタル学習(MTIL)ベンチマークにおいて、ZSCLは先行手法よりも平均精度を9.7%向上させた。
- クラスインクリメンタル学習におけるCIFAR100では、ZSCLは平均精度82.15%、最終タスク精度73.65%を達成し、2番目に良い手法(iCaRL)を+7.68%、+7.73%上回った。
- TinyImageNetでは、ZSCLは平均精度80.27%、最終タスク精度73.57%を達成し、前回の最先端手法(iCaRL)を+10.65%、+8.27%上回った。
- ZSCLは異なる学習順序(例:Order-I と Order-II)においても一貫した性能を発揮し、最終スコアがわずか0.2%低下するにとどまり、高い耐性を示した。
- 特に大きなステップ数がかかる状況下でも、ゼロショット転送と下流タスクの両方における崩壊的忘却が顕著に軽減された。
- アブレーションスタディの結果、元のCLIPモデルを教師とし、多様な参照データセットを用いることが、性能向上の鍵であることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。