Skip to main content
QUICK REVIEW

[論文レビュー] Conditional Computation for Continual Learning

Min Lin, Jie Fu|arXiv (Cornell University)|Jun 16, 2019
Domain Adaptation and Few-Shot Learning参考文献 9被引用数 6
ひとこと要約

この論文では、部分的なパラメータ共有を可能にするクリッピングmaxoutネットワークを用いて、学習中に干渉を受ける例のみを的確に再提示する条件付きリハーより、災難的忘却を低減する手法を提案する。この手法は、MNIST-olで完全な正確性を達成し、忘却を起こさない。ランダムリハーサルよりも、より小さなデータセットで優れた性能を発揮する。

ABSTRACT

Catastrophic forgetting of connectionist neural networks is caused by the global sharing of parameters among all training examples. In this study, we analyze parameter sharing under the conditional computation framework where the parameters of a neural network are conditioned on each input example. At one extreme, if each input example uses a disjoint set of parameters, there is no sharing of parameters thus no catastrophic forgetting. At the other extreme, if the parameters are the same for every example, it reduces to the conventional neural network. We then introduce a clipped version of maxout networks which lies in the middle, i.e. parameters are shared partially among examples. Based on the parameter sharing analysis, we can locate a limited set of examples that are interfered when learning a new example. We propose to perform rehearsal on this set to prevent forgetting, which is termed as conditional rehearsal. Finally, we demonstrate the effectiveness of the proposed method in an online non-stationary setup, where updates are made after each new example and the distribution of the received example shifts over time.

研究の動機と目的

  • 条件付き計算におけるパラメータ共有のレベルを分析することで、継続的学習における災難的忘却を解消する。
  • 干渉を受ける例のみを的確に再提示する手法を開発し、ランダムリハーサルよりも効率を高める。
  • クリッピングmaxoutネットワークを導入することで、学習中の干渉を受ける例の数を削減し、忘却の緩和を促進する。
  • データが逐次到着し、分布が変化する挑戦的なオンラインで非定常な環境での手法の評価を行う。

提案手法

  • 入力xに応じてパラメータΘ(x)を条件づける条件付き計算フレームワークを用い、部分的なパラメータ共有を可能にする。
  • 固定されたグループ化関数G(x)を用いて多対一のマッピングを実施し、共有パラメータグループを定義することで、干渉を同じグループ内の例に限定する。
  • 出力を[0,1]にクリッピングし、0.1以上である値のみを活性とみなすクリッピングmaxoutネットワークを導入する。これにより、干渉を受ける例の集合が削減される。
  • 条件付きリハーサルを、新しい例を学習することでパラメータに影響を受ける歴史的例のみを再提示するものとして定義する。
  • 標準的な交差エントロピー損失と、条件付きで選択された例に対するリハーサル損失を組み合わせたオンライン更新で学習を実行する。
  • 活性値がクリッピングmaxoutユニット内で0.1以上であるかどうかを基準に、どの例が干渉を受けるとみなされるかを閾値を用いて決定する。

実験結果

リサーチクエスチョン

  • RQ1条件付き計算におけるパラメータ共有が干渉および災難的忘却に与える影響は何か?
  • RQ2干渉解析に基づく的確なリハーサルは、ランダムリハーサルよりも効率的に忘却を低減できるか?
  • RQ3クリッピングmaxoutアーキテクチャは、標準的なmaxoutと比較して干渉を受ける例の数を減らせるか?
  • RQ4干渉のないオンラインで非定常な学習環境(分布が変化するデータストリーム)において、条件付きリハーサルはどの程度効果的か?
  • RQ5ランダムリハーサルがカバー不足のため失敗するような複雑なデータセットにおいて、この手法は一般化可能か?

主な発見

  • ミニバッチ単位のmaxoutユニットあたりの再提示例数は、学習中に約100で安定している。これは理論的期待と整合的である。
  • MNIST-olの全データセットにおいて、条件付きリハーサルは100%の訓練正確性を達成し、忘却を起こさない。一方、リハーサルなしのベースラインは学習に失敗する。
  • クラス10例ずつの小さなサブセットにおいて、条件付きリハーサルはランダムリハーサルを著しく上回り、低データ環境下での優位性を示す。
  • 全MNIST-olデータセットでは、ランダムリハーサルと条件付きリハーサルの性能が同等に近いが、データがスパースな場合にはランダムリハーサルは一般化に失敗する。
  • クリッピングmaxoutアーキテクチャにより、干渉を受ける例の数が削減され、より効率的かつ的確なリハーサルが可能になる。
  • 訓練およびテストセットの両方で、正確性の単調な向上を維持しており、忘却を伴わない安定的な継続的学習が実現している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。