[論文レビュー] Learning without Forgetting for Vision-Language Models
この論文では、事前学習済みの画像およびテキストエンコーダーを凍結し、タスク固有のプロジェクションを学習することで、継続的学習における深刻な忘却を防ぐ、新しいビジョン・ランゲージモデルのための方法論であるPROjectiOn Fusion(Proof)を提案する。視覚的および言語的特徴をクロスモダリティ・フュージョンモジュールを通じて統合することで、9つのベンチマークデータセットにおいて最先端の性能を達成するとともに、ゼロショット一般化性能を維持する。
Class-Incremental Learning (CIL) or continual learning is a desired capability in the real world, which requires a learning system to adapt to new tasks without forgetting former ones. While traditional CIL methods focus on visual information to grasp core features, recent advances in Vision-Language Models (VLM) have shown promising capabilities in learning generalizable representations with the aid of textual information. However, when continually trained with new classes, VLMs often suffer from catastrophic forgetting of former knowledge. Applying VLMs to CIL poses two major challenges: 1) how to adapt the model without forgetting; and 2) how to make full use of the multi-modal information. To this end, we propose PROjectiOn Fusion (PROOF) that enables VLMs to learn without forgetting. To handle the first challenge, we propose training task-specific projections based on the frozen image/text encoders. When facing new tasks, new projections are expanded and former projections are fixed, alleviating the forgetting of old concepts. For the second challenge, we propose the fusion module to better utilize the cross-modality information. By jointly adjusting visual and textual features, the model can capture semantic information with stronger representation ability. Extensive experiments on nine benchmark datasets validate PROOF achieves state-of-the-art performance. Code is available at https://github.com/zhoudw-zdw/PROOF
研究の動機と目的
- 継続的学習の過程で、新しいクラスが以前に学習した知識を上書きしてしまうという、深刻な忘却を回避すること。
- 単一のテキスト特徴に依存する制限を克服し、視覚と言語からのマルチモーダル情報の効果的な統合を実現すること。
- 新しい段階的クラスに適応しながらも、強力なゼロショット一般化性能を維持すること。
- データレプレイや事前学習バックボーンの広範な微調整を必要とせず、深刻な忘却を回避する、パラメータ効率的かつスケーラブルなアプローチを開発すること。
- 継続的適応が不可欠なリアルワールドのストリーミングデータ環境における、ビジョン・ランゲージモデルの実用的導入を可能にすること。
提案手法
- 一般化可能な表現を保持し、深刻な忘却を防ぐために、事前学習済みの画像およびテキストエンコーダーを凍結する。
- 古いプロジェクションが固定されたままとなるように、新しいクラスのためのタスク固有の線形プロジェクションヘッドを凍結エンコーダーの上に導入する。
- 視覚的および言語的特徴を共同で調整することで、意味的表現の強化と分類器の耐性向上を図るクロスモダリティ・フュージョンモジュールを用いる。
- 事前学習の目的に一致するように、画像とテキストの埋め込みを共有空間に一致させるために対照的損失を用いてモデルを訓練する。
- パラメータ効率的な適応戦略として、事前学習済み知識への干渉を最小限に抑えるために、唯一プロジェクションヘッドのみを更新する。
- 元のCLIPスタイルのコサイン類似度分類ヘッドを維持することで、未学習クラスにおけるゼロショット転送を可能にする。
実験結果
リサーチクエスチョン
- RQ1ビジョン・ランゲージモデルは、以前に学習した概念の深刻な忘却を回避しつつ、継続的学習に適応できるか。
- RQ2視覚的および言語的特徴のマルチモーダル統合は、段階的学習設定における表現学習をどの程度向上できるか。
- RQ3凍結エンコーダーと学習可能なプロジェクションに依存するパラメータ効率的アプローチが、ビジョン・ランゲージタスクにおける既存の継続的学習ベースラインを上回れるか。
- RQ4新しいクラスに対する継続的訓練の後でも、提案手法は強力なゼロショット一般化性能を維持できるか。
- RQ5共同調整メカニズムを通じた視覚的および言語的特徴の統合は、段階的学習における分類器の耐性をどの程度向上させるか。
主な発見
- Proofは、ImageNet、CUB、Foodを含む9つのベンチマークデータセットにおいて、さまざまなクラスインクリメンタル学習プロトコルで最先端の性能を達成する。
- 標準的な微調整と比較して、深刻な忘却が顕著に軽減され、CUB-200-2011ではベースライン微調整比で最高12.5%の性能向上を達成する。
- 画像およびテキストエンコーダーを凍結し、タスク固有のプロジェクションのみを学習することで、Proofは強力なゼロショット一般化性能を維持し、モデル全体を微調整する手法を上回る。
- クロスモダリティ・フュージョンモジュールにより特徴表現が向上し、SUN-397データセットでは非統合ベースライン比で平均6.8%の精度向上を達成する。
- 特に長尾分布およびローショットの段階的学習シナリオにおいて、iCaRL、L2P、DualPromptといった強力なベースラインを上回る。
- 多様なデータセットにわたる一貫性のある向上を示しており、現実世界の継続的学習環境における強靭性とスケーラビリティを実証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。