Skip to main content
QUICK REVIEW

[論文レビュー] Continual Reinforcement Learning with Complex Synapses

Christos Kaplanis, Murray Shanahan|arXiv (Cornell University)|Feb 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 22被引用数 22
ひとこと要約

本稿では、複数の時間スケールにわたり継続的強化学習における深刻な忘れなげ(catastrophic forgetting)を軽減するため、生物に由来するシナプスモデルを提案する。各ネットワークパラメータを動的変数の鎖で表現することで、経験再生に依存せず、安定した学習が可能になる。相互作用する変数を用いてシナプス記憶のべき乗則減衰を近似することで、経験再生への依存を低減し、タスク境界の事前知識がなくても、連続するタスク間で安定した学習が可能となる。

ABSTRACT

Unlike humans, who are capable of continual learning over their lifetimes, artificial neural networks have long been known to suffer from a phenomenon known as catastrophic forgetting, whereby new learning can lead to abrupt erasure of previously acquired knowledge. Whereas in a neural network the parameters are typically modelled as scalar values, an individual synapse in the brain comprises a complex network of interacting biochemical components that evolve at different timescales. In this paper, we show that by equipping tabular and deep reinforcement learning agents with a synaptic model that incorporates this biological complexity (Benna & Fusi, 2016), catastrophic forgetting can be mitigated at multiple timescales. In particular, we find that as well as enabling continual learning across sequential training of two simple tasks, it can also be used to overcome within-task forgetting by reducing the need for an experience replay database.

研究の動機と目的

  • 人工ニューラルネットワークにおける主な制限要因である継続的強化学習における深刻な忘れなげを解消すること。
  • 生物学的に妥当なシナプスダイナミクス、特に多時間スケール可塑性が、強化学習エージェントにおける安定的かつ永続的な学習を可能にするかを検討すること。
  • Benna-Fusiシナプスモデルが、深層強化学習における経験再生の必要性を低減または排除できるかを検証すること。
  • このモデルが、タスク境界やデータ分布の変化の事前知識がなくても、タスク間およびタスク内における継続的学習をサポートできるかを評価すること。

提案手法

  • シナプスモデルは、Benna & Fusi (2016) のインスピレーションを受けて、合成記憶のべき乗則減衰を近似するため、N 個の動的変数(u_k)の有限鎖を用いる。
  • 各変数 u_k は、相互に接続されたビーカーを通過する流体の流れをモデル化する微分方程式に従い、結合強度(g)と静電容量(C)が記憶減衰の時間スケールを決定する。
  • シナプス重み w は最初の変数(u_1)から読み取られるが、鎖全体が複数の時間スケールにわたる重みの履歴を符号化することで、重みの正則化を実現する。
  • このモデルは、スカラーパラメータを動的シナプス表現に置き換えることで、テーブル型およびディープQネットワークエージェントに統合される。
  • 明示的な重要度重み付けやタスク境界の知識なしに、シナプス鎖の内在的時間スケールダイナミクスに依存して学習が行われる。
  • 本手法は、経験再生あり・なしの両条件で、連続するテーブル型およびディープ強化学習タスクにおいて評価される。

実験結果

リサーチクエスチョン

  • RQ1生物学的に妥当な多時間スケールダイナミクスを有するシナプスモデルは、継続的強化学習における深刻な忘れなげを軽減できるか?
  • RQ2このモデルは、深層強化学習において、経験再生の必要性をどの程度低減または排除できるか?
  • RQ3このモデルは、タスク境界の事前知識がなくても、タスク間およびタスク内両方の状況で安定した学習をサポートできるか?
  • RQ4シナプス鎖内の隠れ変数の数が増加するに従って、このモデルの性能はどのように変化するか?
  • RQ5ドーパミンなどの神経調節シグナルを組み込むことで、モデルの記憶ダイナミクスをさらに向上させられるか?

主な発見

  • Benna-Fusiシナプスモデルは、連続するタスクにおいて、テーブル型およびディープ強化学習エージェントの両方で深刻な忘れなげを効果的に軽減した。
  • 経験再生に依存せず、安定した継続的学習が可能となり、メモリ要件が顕著に低減された。
  • 多時間スケールダイナミクスにより、過去の経験を保持することで、タスク内での忘れなげが低減された。これは、学習中にデータ分布が変化しても同様に有効である。
  • 異なるタスク順序においても性能が安定しており、タスク境界やデータ分布変化の事前知識がなくても、モデルが適応可能であることが示された。
  • Arcade Learning Environment における大規模DQNエージェントを用いた初期実験では、コントロールエージェントより性能が低かった。これはスケーラビリティに限界がある可能性を示唆し、今後のさらなる調査が必要である。
  • モデルの記憶ダイナミクスは本質的に多時間スケールであり、Adam やソフトターゲット更新のような指数関数的減衰モデルよりも長い記憶寿命を持つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。