Skip to main content
QUICK REVIEW

[論文レビュー] Continual Learning in Recurrent Neural Networks

Benjamin Ehret, Christian Henning|arXiv (Cornell University)|Jun 22, 2020
Domain Adaptation and Few-Shot Learning参考文献 76被引用数 13
ひとこと要約

この論文は、再帰的ニューラルネットワーク(RNN)における継続的学習(CL)手法の最初の包括的評価を提供し、オンラインEWCのような重み重要度手法が、再帰的重み再利用によるものではなく、高い作業メモリ要件による柔軟性の低下のため、性能が劣ることを示している。また、ハイパーネットベースの正則化がRNNにおいて重み重要度手法を上回ることを示し、逐次データにおける継続的学習の優れた手法であると確立している。

ABSTRACT

While a diverse collection of continual learning (CL) methods has been proposed to prevent catastrophic forgetting, a thorough investigation of their effectiveness for processing sequential data with recurrent neural networks (RNNs) is lacking. Here, we provide the first comprehensive evaluation of established CL methods on a variety of sequential data benchmarks. Specifically, we shed light on the particularities that arise when applying weight-importance methods, such as elastic weight consolidation, to RNNs. In contrast to feedforward networks, RNNs iteratively reuse a shared set of weights and require working memory to process input samples. We show that the performance of weight-importance methods is not directly affected by the length of the processed sequences, but rather by high working memory requirements, which lead to an increased need for stability at the cost of decreased plasticity for learning subsequent tasks. We additionally provide theoretical arguments supporting this interpretation by studying linear RNNs. Our study shows that established CL methods can be successfully ported to the recurrent case, and that a recent regularization approach based on hypernetworks outperforms weight-importance methods, thus emerging as a promising candidate for CL in RNNs. Overall, we provide insights on the differences between CL in feedforward networks and RNNs, while guiding towards effective solutions to tackle CL on sequential data.

研究の動機と目的

  • 逐次データに対する再帰的ニューラルネットワーク(RNN)における、既存の継続的学習(CL)手法、特に重み重要度アプローチの評価を目的とする。
  • エラスティックウェイトコンsolidation(EWC)のような重み重要度手法が、順方向ネットワークでは成功しているにもかかわらず、RNNではなぜ性能が劣るのかを調査すること。
  • RNNにおける性能低下の根本的原因を、再帰的重み再利用と作業メモリ要件の両者と区別して特定すること。
  • 標準化されたベンチマーク下でのRNNにおける正則化ベースのCL手法(ハイパーネットを含む)の有効性を比較すること。
  • 今後のRNNにおける継続的学習研究のための再現可能なコードベースと、適合された逐次データセットの提供

提案手法

  • 既存のCL手法(特にオンラインEWCとシナプティックインテリジェンス(SI))をRNNに移植し、逐次ベンチマークでの評価を実施した。
  • 作業メモリ効率の高いEWCの変種であるオンラインEWCを用い、フィッシャー情報に基づいてパラメータ重要度を計算し、重要な重みへの更新制限を実施した。
  • タスクの条件付き計算を導入し、タスクID(例:ワンホットエンコーディング)を追加入力として供給することで、RNNにおける選択的処理を可能にした。
  • コピータスク、順次ストロークMNIST、AudioSet、多言語POSタグ付きの複数の逐次タスクにおける平均正答率を用いて性能を評価した。
  • 線形RNNにおける理論的分析を行い、安定性と柔軟性のトレードオフに関する実験的発見を裏付けた。
  • タスク固有の重みを生成するハイパーネットベースの正則化手法(HNET)をベンチマーク化し、動的でタスクに適応したパラメータ更新を可能にした。

実験結果

リサーチクエスチョン

  • RQ1なぜEWCのような重み重要度手法は、順方向ネットワークでは成功しているにもかかわらず、RNNでは性能が劣るのか?
  • RQ2RNNにおける性能低下は、シーケンス長に起因する再帰的重み再利用によるものか、それとも高い作業メモリ要件によるものか?
  • RQ3タスクの条件付き計算は、RNNにおける重み重要度手法の性能を向上させることができるか?
  • RQ4ハイパーネットベースの正則化手法は、RNNにおける継続的学習において重み重要度手法と比べてどのように異なるか?
  • RQ5適切にチューニングされた場合、既存のCL手法は、RNNにおける逐次データの継続的学習において、どれほど強力なベースラインとして機能するのか?

主な発見

  • RNNにおける重み重要度手法の性能は、シーケンス長の直接的要因ではなく、作業メモリ要件の増加によるものであり、安定性は向上するが柔軟性(プラスティシティ)が低下する。
  • m=2の順次スプリット-SMNISTタスクにおいて、タスクIDを入力として提供しない場合、オンラインEWCの最終正答率は88.51%に低下したが、条件付き計算を有効にすると95.71%に向上した。
  • AudioSetベンチマークでは、オンラインEWCはタスク条件付き入力ありで66.35%の最終正答率を達成したのに対し、なしでは65.56%であった。明示的なタスク条件付けによる明確な利点が確認された。
  • ハイパーネットベースの手法(HNET)は、すべてのベンチマークでオンラインEWCを上回り、コピータスクでは95.78%の平均最終正答率を達成したのに対し、オンラインEWCは68.41%であった。
  • 線形RNNにおける理論的分析は、実験的発見を裏付け、RNNにおける安定性と柔軟性のトレードオフは、再帰的重み再利用ではなく作業メモリ要件が主因であることを示唆している。
  • 以前の懸念とは裏腹に、タスクIDが明示的に入力として提供される場合、オンラインEWCは単純なCLシナリオにおいても強力なベースラインのままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。