Skip to main content
QUICK REVIEW

[論文レビュー] Routing Networks with Co-training for Continual Learning

Mark Collier, Efi Kokiopoulou|arXiv (Cornell University)|Sep 9, 2020
Domain Adaptation and Few-Shot Learning参考文献 24被引用数 9
ひとこと要約

本論文は、継続的学習における深刻な忘却を軽減するため、タスク固有のエキスパートルーティングを活用したスパースルーティングネットワークと共同学習を提案する。類似したタスクは共有エキスパートにルーティングされ、相違するタスクは分離したエキスパートにルーティングされることで、干渉を低減し、MNIST-PermutationsおよびMNIST-Rotationsベンチマークにおける性能を向上させる。小さなエピソードメモリバッファを用いることで、性能が向上する。

ABSTRACT

The core challenge with continual learning is catastrophic forgetting, the phenomenon that when neural networks are trained on a sequence of tasks they rapidly forget previously learned tasks. It has been observed that catastrophic forgetting is most severe when tasks are dissimilar to each other. We propose the use of sparse routing networks for continual learning. For each input, these network architectures activate a different path through a network of experts. Routing networks have been shown to learn to route similar tasks to overlapping sets of experts and dissimilar tasks to disjoint sets of experts. In the continual learning context this behaviour is desirable as it minimizes interference between dissimilar tasks while allowing positive transfer between related tasks. In practice, we find it is necessary to develop a new training method for routing networks, which we call co-training which avoids poorly initialized experts when new tasks are presented. When combined with a small episodic memory replay buffer, sparse routing networks with co-training outperform densely connected networks on the MNIST-Permutations and MNIST-Rotations benchmarks.

研究の動機と目的

  • 順次学習される中で、ニューラルネットワークが以前に学習したタスクの性能が低下する深刻な忘却を解消すること。
  • タスク数に比例してネットワークサイズを線形に拡大する必要のない、固定容量のアーキテクチャを開発すること。
  • 類似したタスク間での正の転移を可能にしつつ、相違するタスク間の干渉を最小限に抑えること。
  • 継続的学習中にルーティングネットワークのエキスパートが不適切に初期化される問題を克服し、最適でないルーティングや干渉を回避すること。
  • スパースルーティングネットワークとエピソードメモリを組み合わせることで、継続的学習における安定性と性能を向上させること。

提案手法

  • 各レイヤーに複数のエキスパートを備えたスパースルーティングネットワークアーキテクチャを用い、各エキスパートは完全結合の順方向ネットワークである。
  • タスクIDに条件付けられたルーティング行列を用いて、入力ごとにどのエキスパートがアクティブ化されるかを決定し、スパースでタスク固有のルーティングを実現する。
  • 共同学習を導入:新しいタスクの学習中に、未使用のエキスパートにも入力を通すことで、それらが未訓練のまま残らないようにする。
  • ルーティング確率をマスクとして用い、勾配降下法を実行する際にはアクティブ化されたエキスパートのみを更新することで、勾配干渉を低減する。
  • スパースルーティングネットワークと小さなエピソードメモリリプレイバッファ(サイズ1,000)を組み合わせ、さらに学習の安定性を向上させる。
  • ルーティング行列を自身と行列乗算することで、タスクの類似性を推定し、ルーティングパターンをタスク埋め込みとして可視化する。

実験結果

リサーチクエスチョン

  • RQ1スパースルーティングネットワークが、類似したタスクを共有エキスパートにルーティングすることで、継続的学習における深刻な忘却を軽減できるか?
  • RQ2共同学習が、継続的学習中に未使用エキスパートの不良初期化を効果的に防止できるか?
  • RQ3スパースルーティングネットワークの性能は、継続的学習ベンチマークにおいて標準的な共有ボトムアーキテクチャと比較してどうなるか?
  • RQ4ルーティング行列は、回転角度が増加するMNIST-Rotationsのような状況で、意味のあるタスク類似性を捉えられるか?
  • RQ5スパースルーティングネットワークとエピソードメモリを組み合わせることで、平均精度が向上し、負の後退的転移が軽減されるか?

主な発見

  • 共同学習を施したルーティングネットワークは、MNIST-PermutationsおよびMNIST-Rotationsベンチマークの両方で、共有ボトムアーキテクチャよりも高い平均精度を達成した。
  • 本手法は、負の後退的転移を顕著に低減し、時間の経過とともにタスクの精度曲線が平坦に保たれるようになった。これは、初期タスクの忘却が少ないことを示している。
  • MNIST-Rotationsでは、推定されたタスク類似度行列において、ブロック対角構造が観察された。これは、類似したタスク(回転角度が近い)がエキスパートを共有していることを確認している。
  • 回転角度が著しく異なるタスク(例:0°と180°)は、ほとんどが分離したエキスパートセットを有しており、干渉が最小限に抑えられ、負の転移を避ける設計の目的を達成している。
  • わずかに初期のサンプル効率が低いものの、本手法は全タスクにおいて安定した性能を維持し、長期的な継続的学習において、共有ボトムモデルを上回った。
  • ルーティング確率を介したタスク埋め込みの学習能力により、タスク類似度の解釈可能なクラスタリングが可能となり、MNIST-Rotationsにおける期待される幾何的関係と整合した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。