Skip to main content
QUICK REVIEW

[論文レビュー] Class-Incremental Learning via Knowledge Amalgamation

Marcus de Carvalho, Mahardhika Pratama|arXiv (Cornell University)|Sep 5, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本稿では、複数の異種教師モデル(それぞれ過去のタスクで訓練済み)の知識を、ラベルなしサンプルの小さなメモリのみを用いて、1つのコン act な学生モデルに蒸留するpost-processing手法である、知識統合を用いたクラスインクリメンタル学習(CFA)を提案する。CFAは最小限のメモリ使用量で最先端の性能を達成し、既存のオフライン学習パイプラインへのシームレスな統合が可能であり、強力な一般化性能とバックワード/フォワード知識移行を示している。

ABSTRACT

Catastrophic forgetting has been a significant problem hindering the deployment of deep learning algorithms in the continual learning setting. Numerous methods have been proposed to address the catastrophic forgetting problem where an agent loses its generalization power of old tasks while learning new tasks. We put forward an alternative strategy to handle the catastrophic forgetting with knowledge amalgamation (CFA), which learns a student network from multiple heterogeneous teacher models specializing in previous tasks and can be applied to current offline methods. The knowledge amalgamation process is carried out in a single-head manner with only a selected number of memorized samples and no annotations. The teachers and students do not need to share the same network structure, allowing heterogeneous tasks to be adapted to a compact or sparse data representation. We compare our method with competitive baselines from different strategies, demonstrating our approach's advantages.

研究の動機と目的

  • 複数の異種教師モデルからの知識蒸留を可能にすることで、クラスインクリメンタル学習における深刻な忘却を緩和する。
  • 既存のオフライン学習パイプラインにスムーズに統合できる手法を構築し、オンライン継続的学習への完全な移行を必要としない。
  • 教師モデルと学生モデルのアーキテクチャが異なっていても、計算コストとメモリコストを限定的に保ちながら、すべてのタスクで高い性能を維持する。
  • 推論時にタスク識別子が与えられない状況でも、ゼロショット一般化と効果的なバックワード/フォワード知識移行を可能にする。
  • 新しいクラスが追加された際に、モデルを再訓練せずに再利用可能なpost-processingソリューションを提供する。

提案手法

  • 従来のオフライン学習を用いて、過去のタスクごとに独立してタスク特化型の教師モデルを訓練する。
  • 知識統合のためのメモリとして、過去のタスクから小さな固定セットのラベルなしサンプルを選択する。
  • 記憶されたサンプル上で、すべての教師モデルの出力を模倣するように1つの学生モデルを訓練する。この際、知識蒸留を用いる。
  • 学生モデルの潜在空間を複数のタスク間で一致させるために、共同表現学習(JRL)損失を導入し、一般化性能を向上させる。
  • 教師と学生の特徴間の分布シフトを低減するために、ソフトドメイン適応(SDA)を適用し、知識移行を強化する。
  • 教師と学生の間でアーキテクチャの異種性を許容することで、アーキテクチャ制約なしにコン act またはスパースな学生モデルを実現できる。

実験結果

リサーチクエスチョン

  • RQ1複数の異種教師モデルからの知識を、クラスインクリメンタル学習における深刻な忘却を軽減するために、1つの学生モデルに効果的に統合できるか?
  • RQ2既存の継続的学習ベースラインと比較して、限られたメモリ予算下でも本手法の性能はどのようになるか?
  • RQ3微調整なしで、未学習のクラスに対して学生モデルがどの程度一般化できるか(ゼロショット学習)?
  • RQ4JRLとSDAの各構成要素が、学生モデルにおける知識移行と安定性にどの程度寄与しているか?
  • RQ5本手法は、アーキテクチャやトレーニングパイプラインの変更なしに、既存のオフライン学習パイプラインにシームレスに統合可能か?

主な発見

  • Split CIFAR-10で1000サンプルのメモリ予算下において、CFAは74.96%の精度を達成し、同じ条件下でDER(72.99%)、DER++(77.86%)、FDR(41.91%)を上回る性能を示した。
  • 固定1000サンプルのメモリ予算下で、CFA${}_{\text{fixed}}$はSplit CIFAR-10で74.96%、Split CIFAR-100で27.76%の精度を維持し、極めて少ないメモリ使用量で優れた性能を発揮した。
  • アブレーションスタディの結果、共同表現学習(JRL)が性能向上の主因であることが確認された。JRLを無効化した場合でさえ、SDAを適用しても精度は69.68%に低下した。
  • CFA${}_{\text{grow}}$は、メモリ容量の増加に伴い性能が向上し、2000サンプルでSplit CIFAR-10で79.40%の精度に達した。これは、増大するメモリ予算下でのスケーラビリティを示している。
  • 本手法は効果的なバックワードおよびフォワード知識移行を可能にし、タスク間での強力な一般化性能とゼロショット学習の可能性を示した。
  • CFAは、再トレーニングを必要とせず、既存のオフラインモデルに対してpost-processingとして適用可能なため、優れたメモリ効率と統合可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。