Skip to main content
QUICK REVIEW

[論文レビュー] Overcoming Catastrophic Interference in Online Reinforcement Learning with Dynamic Self-Organizing Maps

Yat Long Lo, Sina Ghiassian|arXiv (Cornell University)|Oct 29, 2019
Data Stream Mining Techniques被引用数 6
ひとこと要約

本稿では、経験回帰やターゲットネットワークを用いずに、災難的干渉(catastrophic interference)を軽減するオンラインで完全に逐次的な強化学習のための動的自己組織化マップ(DSOM)を強化したニューラルネットワークを提案する。DSOMを用いて状態に依存する局所的更新マスクを生成することで、干渉を低減する局所的重み更新を可能にし、Mountain CarおよびLunar LanderでERベースの手法と同等またはそれ以上の性能を達成する。この際、隠れユニットの数も少ない。

ABSTRACT

Using neural networks in the reinforcement learning (RL) framework has achieved notable successes. Yet, neural networks tend to forget what they learned in the past, especially when they learn online and fully incrementally, a setting in which the weights are updated after each sample is received and the sample is then discarded. Under this setting, an update can lead to overly global generalization by changing too many weights. The global generalization interferes with what was previously learned and deteriorates performance, a phenomenon known as catastrophic interference. Many previous works use mechanisms such as experience replay (ER) buffers to mitigate interference by performing minibatch updates, ensuring the data distribution is approximately independent-and-identically-distributed (i.i.d.). But using ER would become infeasible in terms of memory as problem complexity increases. Thus, it is crucial to look for more memory-efficient alternatives. Interference can be averted if we replace global updates with more local ones, so only weights responsible for the observed data sample are updated. In this work, we propose the use of dynamic self-organizing map (DSOM) with neural networks to induce such locality in the updates without ER buffers. Our method learns a DSOM to produce a mask to reweigh each hidden unit's output, modulating its degree of use. It prevents interference by replacing global updates with local ones, conditioned on the agent's state. We validate our method on standard RL benchmarks including Mountain Car and Lunar Lander, where existing methods often fail to learn without ER. Empirically, we show that our online and fully incremental method is on par with and in some cases, better than state-of-the-art in terms of final performance and learning speed. We provide visualizations and quantitative measures to show that our method indeed mitigates interference.

研究の動機と目的

  • ニューラルネットワークがグローバルな重み更新によって過去の知識を忘れてしまう、オンラインで完全に逐次的な強化学習における災難的干渉を解消すること。
  • 記憶集約的で実用的でない経験回帰バッファやターゲットネットワークに依存しないようにすること。
  • 状態の類似性に基づいて重み更新を局所化することで、記憶効率の高い方法を構築し、安定した逐次的学習を可能にすること。
  • DSOMを用いた局所的、状態依存の更新が、ERおよびターゲットネットワークを用いる最先端の手法と同等またはそれ以上の性能を達成できることを示すこと。
  • 活性化局在化と干渉度指標を含む定性的および定量的測定によって、干渉がどのように低減されたかを検証すること。

提案手法

  • 状態に依存するマスクを生成するために動的自己組織化マップ(DSOM)を導入し、各隠れユニット出力の寄与度を調整する。
  • DSOMを用いて重み更新を条件づけ、現在の状態に応答する隠れユニットのみを更新することで、学習プロセスを局所化する。
  • マスクを適用して隠れユニットの活性化を再重み付けし、更新がわずかで関連するパラメータのサブセットにのみ影響を与えるようにする。これにより干渉が低減される。
  • 特に高次元状態空間において干渉をさらに低減するため、ラインサーチを組み込んだAdam(ALR)最適化手法を採用する。
  • DSOMとニューラルネットワークをエンドツーエンドで同時に学習させ、マップが状態固有の表現を適応的に学習できるようにする。
  • 経験回帰とターゲットネットワークを完全に回避することで、最小限の記憶オーバーヘッドで完全にオンラインで逐次的な学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1記憶効率の高い、オンラインで完全に逐次的な強化学習手法は、経験回帰バッファなしで災難的干渉を軽減できるか?
  • RQ2動的自己組織化マップを用いて重み更新を局所化することで、ニューラルネットワークにおけるグローバル更新と比較して干渉が低減するか?
  • RQ3DSOMに基づく局所化により、より少ない隠れユニットで効果的な学習が可能になり、サンプル効率およびパラメータ効率が向上するか?
  • RQ4標準的なRLベンチマークにおいて、ERベースのベースラインと比較して、最終的な性能と学習速度の点で本手法はどのように差をつけるか?
  • RQ5活性化重なりと定量的干渉度指標によって測定した場合、本手法はどの程度干渉を低減するか?

主な発見

  • 提案手法は、経験回帰やターゲットネットワークなしでも、Mountain CarおよびLunar LanderでERベースの手法と同等またはそれ以上の性能を達成した。
  • Mountain Carでは、わずか36個の隠れユニットでタスクを解決した。これはベースラインと比較して顕著に少ない数であり、パラメータ効率の向上を示している。
  • 定量的干渉度測定では、DSOM手法が全手法の中で最小の干渉スコア(0.1079)を示し、状態間での活性化重なりが最小限であることを示した。
  • 可視化結果から、DSOMの隠れユニットが状態空間の局所的領域にのみ反応することが確認され、本手法が局所的で特化した表現を誘導できることを裏付けた。
  • ERベースの手法よりも高速に学習を進め、安定した性能を維持した。一方、ERベースの手法は学習の不安定さと性能の低下を示した。
  • ALR最適化手法を除去すると、すべての手法で性能が低下した。これは、特にターゲットネットワークが存在しない状況下で、ALRが学習の安定化に重要な役割を果たしていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。