Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Nonparametric Weight Factorization for Continual Learning.

Nikhil Mehta, Kevin J Liang|arXiv (Cornell University)|Apr 21, 2020
Domain Adaptation and Few-Shot Learning参考文献 30被引用数 5
ひとこと要約

本稿では、タスクの複雑さに応じてモデル拡張を動的に決定するためのベイジアン非パラメトリックな重み因子分解手法を提案する。インド・バーベッジ過程(IBP)の事前分布を用いることで、ニューラルネットワークの重みを因子に分解し、スパarsityと因子の再利用を促進することで、データ駆動型の適応的でスケーラブルなモデル拡張を実現するとともに、タスク間での知識移行を促進する。この手法は、継続的学習のベンチマークにおいて、固定拡張のベースラインを上回る性能を発揮する。

ABSTRACT

Naively trained neural networks tend to experience catastrophic forgetting in sequential task settings, where data from previous tasks are unavailable. A number of methods, using various model expansion strategies, have been proposed recently as possible solutions. However, determining how much to expand the model is left to the practitioner, and typically a constant schedule is chosen for simplicity, regardless of how complex the incoming task is. Instead, we propose a principled Bayesian nonparametric approach based on the Indian Buffet Process (IBP) prior, letting the data determine how much to expand the model complexity. We pair this with a factorization of the neural network's weight matrices. Such an approach allows us to scale the number of factors of each weight matrix to the complexity of the task, while the IBP prior imposes weight factor sparsity and encourages factor reuse, promoting positive knowledge transfer between tasks. We demonstrate the effectiveness of our method on a number of continual learning benchmarks and analyze how weight factors are allocated and reused throughout the training.

研究の動機と目的

  • 入ってくるタスクの複雑さに基づいてモデルの複雑さを動的にスケーリングすることで、継続的学習における深刻な忘却( catastrophic forgetting )を緩和すること。
  • 固定スケジュールに置き換えるデータ駆動型メカニズムを導入することで、モデル拡張の手動によるハイパーパrameterチューニングの必要性を排除すること。
  • 重み行列における因子の再利用を通じて、タスク間でのポジティブな知識移行を促進すること。
  • ニューラルネットワークの重み行列における要因数の決定に、原理的で非パラメトリックな手法を提供すること。
  • 標準的な継続的学習ベンチマークにおいて、要因の割り当てと再利用の分析を含めて、本手法の有効性を示すこと。

提案手法

  • 重み行列における要因数をモデル化するためにインド・バーベッジ過程(IBP)の事前分布を用い、データがモデルの複雑さを決定できるようにする。
  • ニューラルネットワークの重み行列に低ランク因子分解を適用し、共有要因とタスク固有の要因に分解する。
  • IBP事前分布を用いて要因負荷行列におけるスパarsityを強制し、各タスクで関連する要因のみが活性化されるようにする。
  • データがそれを支持する場合に同じ要因を複数のタスクで共有することで、要因の再利用を可能にし、知識移行を促進する。
  • エンドツーエンドの最適化を確率的勾配法で行いながら、IBP事前分布の非パラメトリック性を維持し、動的拡張を実現する。
  • 事前に指定せずに、各レイヤーの要因数を入ってくるタスクの複雑さに応じて適応的にスケーリングする。

実験結果

リサーチクエスチョン

  • RQ1固定スケジュールに依存するのではなく、タスクの複雑さに応じて継続的学習におけるモデル拡張をどのように動的に適応可能にすることができるか?
  • RQ2タスク間での要因の再利用は、知識移行をどの程度向上させ、忘却をどの程度軽減するか?
  • RQ3IBP事前分布は、逐次的なタスク学習の過程で要因の割り当てとスパarsityにどのように影響を与えるか?
  • RQ4動的要因スケーリングは、継続的学習ベンチマーク全体のパフォーマンスにどのような影響を与えるか?
  • RQ5固定拡張ベースラインと比較して、本手法は忘却と精度の観点でどの程度優れているか?

主な発見

  • 本手法は、タスクの複雑さに応じてモデルの複雑さを動的に適応させることで、複数の継続的学習ベンチマークで最先端の性能を達成した。
  • IBP事前分布は要因負荷行列におけるスパarsityをうまく誘導し、効率的で解釈可能な要因の使用を実現した。
  • 要因の再利用がタスク間で顕著に観察され、有効なポジティブな知識移行が実現していることが示された。
  • モデルはタスクの複雑さに応じてレイヤーごとの要因数をスケーリングしており、過剰パラメータ化やアンダーフィッティングを回避した。
  • 平均精度と深刻な忘却の低減の両面で、固定拡張ベースラインを上回る性能を発揮した。
  • 分析の結果、複雑なタスクはより多くの要因を活性化するのに対し、単純なタスクは既存の要因を再利用する傾向があり、適応的動作が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。