Skip to main content
QUICK REVIEW

[論文レビュー] Online Coreset Selection for Rehearsal-based Continual Learning

Jaehong Yoon, Divyam Madaan|arXiv (Cornell University)|Jun 2, 2021
Domain Adaptation and Few-Shot Learning参考文献 46被引用数 40
ひとこと要約

OCS は minibatch の類似性、サンプル多様性、コアセットの親和性を用いて、各イテレーションで代表的かつ情報量の多いサンプルを選択し、タスク適応を改善しつつ忘却を減らす rehearsal ベースの継続学習のオンラインコアセット選択を提案します。

ABSTRACT

A dataset is a shred of crucial evidence to describe a task. However, each data point in the dataset does not have the same potential, as some of the data points can be more representative or informative than others. This unequal importance among the data points may have a large impact in rehearsal-based continual learning, where we store a subset of the training examples (coreset) to be replayed later to alleviate catastrophic forgetting. In continual learning, the quality of the samples stored in the coreset directly affects the model's effectiveness and efficiency. The coreset selection problem becomes even more important under realistic settings, such as imbalanced continual learning or noisy data scenarios. To tackle this problem, we propose Online Coreset Selection (OCS), a simple yet effective method that selects the most representative and informative coreset at each iteration and trains them in an online manner. Our proposed method maximizes the model's adaptation to a current dataset while selecting high-affinity samples to past tasks, which directly inhibits catastrophic forgetting. We validate the effectiveness of our coreset selection mechanism over various standard, imbalanced, and noisy datasets against strong continual learning baselines, demonstrating that it improves task adaptation and prevents catastrophic forgetting in a sample-efficient manner.

研究の動機と目的

  • 実データ条件(不均衡、ノイズ)下で、リハーサルベースの継続学習において高品質なコアセットをどのように選択するか。
  • 現在タスクの関連性を重視しつつ過去タスクへの干渉を最小化する、オンラインの勾配ベースのコアセット選択機構を開発する。
  • 既存のリハーサルベースCL手法と互換性があり、単純でスケーラブルな方法を提供する。
  • バランスデータ、アンバランスデータ、およびノイズデータの状況での堅牢性を示し、ベースラインCL手法との協調を示す。

提案手法

  • 現在のミニバッチに対するデータ点の代表性を測るミニバッチ類似性(S)を定義する。
  • 選択サンプル間の冗長性を減らすサンプル多様性(V)を定義する。
  • 過去タスク知識からの勾配への干渉を最小化するコアセット親和性(A)を定義する。
  • S + V + τ*A を最大化することで、ミニバッチあたりのトップkサンプルを選択する。τ は可塑性と安定性を制御する。
  • 現在のタスクのコアセットとリプレイバッファのサンプルで学習し、現在のタスク適応と過去タスクリプレイのバランスを取る結合損失でモデルを更新する(式9)。
  • 各ミニバッチごとにオンラインコアセット構築を有効にし、固定サイズのリプレイバッファ(J)へコアセットを順次記憶させることで継続学習を行う。

実験結果

リサーチクエスチョン

  • RQ1リハーサルベースのCLにおいて、現在のタスクの適応を最大化しつつ過去タスクの知識を保護するように、オンラインでコアセットをどのように選択できるか?
  • RQ2勾配ベースの基準(類似性、多様性、親和性)は、現実的なデータストリーム全体で忘却を減らす代表的で冗長性のないコアセットを生み出すか?
  • RQ3提案されたオンラインコアセット選択(OCS)手法は、不均衡・ノイズ設定を含むさまざまなCLベンチマークやベースラインと互換性があるか?

主な発見

  • OCSは、平均精度と忘却の観点で、バランスの取れた、不均衡、ノイズのある継続学習ベンチマークにおいて、強力なリハーサルベースのベースラインよりも性能を発揮する。
  • OCSは、リプレイバッファをランダムまたは均一サンプルではなく、選択的にキュレーションすることでサンプル効率の高い改善を示す。
  • OCSは、コアセットサイズの変化にも有効で、より大きなエピソードメモリ予算でよく機能する。
  • OCSは既存のCL手法と互換性があり、タスク適応を協調的に高め、忘却を緩和できる。
  • アブレーション研究は、生データ入力ベースラインよりも勾配ベース基準の利点を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。