Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning with Recursive Gradient Optimization

Hao Liu, Huaping Liu|arXiv (Cornell University)|Jan 29, 2022
Domain Adaptation and Few-Shot Learning被引用数 8
ひとこと要約

本稿では、データリプレイを用いず、固定容量のネットワークにおける忘却を最小限に抑える正則化に基づく継続的学習手法である再帰的勾配最適化(RGO)を提案する。RGOは、2次損失上界とタスク固有の構造を備えた仮想特徴エンコーディング層(FEL)を用いて勾配を再帰的に修正することで、明示的なハイパーパramータのバランス調整を必要としない。RGOは20分割CIFAR100(82.22%)および20分割miniImageNet(72.63%)で最先端の性能を達成し、既存の固定容量ベースラインを上回り、単一タスク学習の精度に匹敵またはそれを上回る。

ABSTRACT

Learning multiple tasks sequentially without forgetting previous knowledge, called Continual Learning(CL), remains a long-standing challenge for neural networks. Most existing methods rely on additional network capacity or data replay. In contrast, we introduce a novel approach which we refer to as Recursive Gradient Optimization(RGO). RGO is composed of an iteratively updated optimizer that modifies the gradient to minimize forgetting without data replay and a virtual Feature Encoding Layer(FEL) that represents different long-term structures with only task descriptors. Experiments demonstrate that RGO has significantly better performance on popular continual classification benchmarks when compared to the baselines and achieves new state-of-the-art performance on 20-split-CIFAR100(82.22%) and 20-split-miniImageNet(72.63%). With higher average accuracy than Single-Task Learning(STL), this method is flexible and reliable to provide continual learning capabilities for learning models that rely on gradient descent.

研究の動機と目的

  • データリプレイやネットワーク容量の増加に依存せずに、継続的学習における深刻な忘却を解消すること。
  • 現在のタスクの性能を維持しつつ、忘却を最小限に抑える勾配ベースの最適化手法を開発すること。
  • 標準の学習率および最適化手法の挙動を保ちながら、既存のディープラーニングモデルおよび学習戦略との互換性を確保すること。
  • モデルサイズを拡大せずに、パラメータフリーのタスクエンコーディング機構を導入し、タスク間の干渉を低減すること。

提案手法

  • RGOは、過去のタスク損失の2次上界に基づき、勾配の方向を再帰的に最適化することで、明示的なハイパーパramータのバランス調整を必要とせずに忘却を最小化する。
  • 現在のタスクの学習率を維持するためのトレース正規化プロセスを導入し、標準の単一タスク学習プロトコルとの互換性を確保する。
  • 各実際の層の直後に仮想特徴エンコーディング層(FEL)を挿入し、タスクIDをランダムシードとして用いて特徴マップを並び替えることで、タスク固有の仮想構造を生成する。
  • FELにより、パラメータを追加せずにタスク固有の挙動を実現し、タスク間でネットワークのフィッティング能力を保持する。
  • 過去のタスク損失を推定するために2次テイラー展開を用い、ヘシアンに基づく勾配補正を用いてパラメータの更新を誘導する。
  • 本手法は標準の誤差逆伝播法と互換性があり、ほとんどのディープラーニングフレームワークに最小限のオーバーヘッドで統合可能である。

実験結果

リサーチクエスチョン

  • RQ1勾配ベースの継続的学習手法は、データリプレイやアーキテクチャの拡張なしに最先端の性能を達成できるか?
  • RQ2忘却を最小限に抑えつつ現在のタスクの性能を維持するため、勾配修正をどのように再帰的に最適化できるか?
  • RQ3パラメータフリーのタスクエンコーディング機構は、固定容量ネットワークにおけるタスク間干渉を効果的に低減できるか?
  • RQ4現在のタスクを最優先とする原則は、従来の損失バランス手法に比べて、どの程度優れているか?
  • RQ5本手法は、既存の正則化法およびメモリベースの手法と比較して、忘却と精度の両面でどの程度優れているか?

主な発見

  • RGOは20分割CIFAR100ベンチマークで82.22%という新しい最先端の精度を達成し、既存の固定容量手法を顕著に上回った。
  • 20分割miniImageNetでは72.63%の精度を達成し、新たな最先端結果を樹立し、異なるデータセット間での強力な一般化性能を示した。
  • RGOは平均精度を単一タスク学習(STL)と同等またはそれ以上に維持しており、継続的学習による性能劣化が最小限であることが示された。
  • 本手法は標準のディープラーニングフレームワークと完全に互換性があり、標準の誤差逆伝播法に加え、定数時間および定数メモリのオーバーヘッドで実装可能である。
  • 仮想特徴エンコーディング層(FEL)は、パラメータを追加せずに効果的なタスク固有の挙動を実現し、モデル容量と一般化性能を保持した。
  • 実験により、RGOは正則化ベースのベースラインよりも忘却をより効果的に低減しており、ハイパーパramータチューニングやメモリリプレイの必要がないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。