Skip to main content
QUICK REVIEW

[論文レビュー] Understanding and Preventing Capacity Loss in Reinforcement Learning

Clare Lyle, Mark Rowland|arXiv (Cornell University)|Apr 20, 2022
Reinforcement Learning in Robotics被引用数 10
ひとこと要約

この論文は、報酬が疎な環境における性能の悪さの主な要因であるとされる『容量損失』——学習過程において新しい価値関数を学習する能力の低下——を同定する。本研究では、初期値に向かって補助出力を正則化することで表現学習を安定化させる、初期特徴正則化(InFeR)を提案。これにより、高度な探索アルゴリズムを用いずに、モンテズマのレインボーや同様の困難な探索タスクで顕著な性能向上が達成された。

ABSTRACT

The reinforcement learning (RL) problem is rife with sources of non-stationarity, making it a notoriously difficult problem domain for the application of neural networks. We identify a mechanism by which non-stationary prediction targets can prevent learning progress in deep RL agents: extit{capacity loss}, whereby networks trained on a sequence of target values lose their ability to quickly update their predictions over time. We demonstrate that capacity loss occurs in a range of RL agents and environments, and is particularly damaging to performance in sparse-reward tasks. We then present a simple regularizer, Initial Feature Regularization (InFeR), that mitigates this phenomenon by regressing a subspace of features towards its value at initialization, leading to significant performance improvements in sparse-reward environments such as Montezuma's Revenge. We conclude that preventing capacity loss is crucial to enable agents to maximally benefit from the learning signals they obtain throughout the entire training trajectory.

研究の動機と目的

  • 報酬が疎な環境において、十分な探索が行われているにもかかわらず、なぜ深層強化学習エージェントが学習に失敗するのかを調査すること。
  • ニューラルネットワークが時間経過とともに新しい予測ターゲットを適合させる能力を失うという、これまで無視されてきたメカニズム「容量損失」を同定すること。
  • 非定常なターゲットによって引き起こされる表現の崩壊が、深層強化学習における学習進捗を妨げることを示すこと。
  • 容量損失を防ぐシンプルで効果的な正則化手法、初期特徴正則化(InFeR)を提案し、実証的に検証すること。
  • 単純な探索戦略でも、改善された表現学習が強力な性能を実現できることを示し、性能の悪さが探索の失敗に起因するとする仮定に疑問を呈すること。

提案手法

  • 著者らは、初期値に向かって補助出力を正則化することで、ネットワークの表現空間を安定化させる正則化手法である初期特徴正則化(InFeR)を導入する。
  • InFeRは、固定された小さなL2ペナルティを用いて、ネットワークの特徴空間を正則化し、新しい関数を表現する能力を維持する。
  • この手法はQネットワークの直前層に適用され、補助出力が同じ入力に対して初期ネットワークの出力と一致するように学習される。
  • 正則化は計算コストが低く、わずかな固定L2損失項以外に追加コストを発生させない。
  • 著者らは、特に報酬が疎なゲーム(例:モンテズマのレインボー)を含む複数のAtari環境で、InFeRを実験的に評価する。
  • 線形分離可能性と特徴空間の崩壊を用いて表現動態を分析し、訓練過程における状態の区別能がどの程度維持されているかを測定する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習の訓練過程において、新しいターゲット関数を適合させる能力が低下する『容量損失』は、どの程度顕著に発生するか?
  • RQ2報酬が疎な環境で深層強化学習エージェントが学習に失敗するのはなぜか?これは探索の不備によるものか、表現学習の不備によるものか?
  • RQ3特徴が低次元部分空間に収縮する表現の崩壊は、深層強化学習エージェントの性能低下と相関するか?
  • RQ4シンプルで固定された正則化手法(例:InFeR)は、容量損失を軽減し、困難な環境での性能向上に寄与するか?
  • RQ5InFeRとベースラインエージェントの性能差は、モデルの過小パラメータ化に起因するものか?ネットワークの幅を倍増させることでこの差は解消されるか?

主な発見

  • 容量損失は、報酬が疎な環境(例:モンテズマのレインボー)において広く顕在する深刻な現象であり、十分な探索が行われてもエージェントが学習に失敗する原因となる。
  • 報酬が疎な環境では表現の崩壊が急速に発生し、特徴出力が低次元またはゼロ次元の部分空間に収縮する。これにより、エージェントの状態の区別能力が著しく損なわれる。
  • InFeRは、モンテズマのレインボーのような困難な探索ゲームにおいて顕著な性能向上を達成し、特別な探索アルゴリズムを用いずに最先端の結果を実現した。
  • ネットワークの幅を2倍にした場合、InFeRとベースラインエージェントの性能差は消失または逆転する。これは性能差が正則化自体に起因するのではなく、モデルの過小パラメータ化に起因することを示唆する。
  • 著者らは、十分な表現能力が学習進捗のための必要条件であると判明し、InFeRがネットワークの関数空間ダイナミクスを安定化させることで、この能力を維持していることを示した。
  • InFeRは関数空間正則化の一種として機能し、非定常な強化学習環境における連続的予測タスク間の一般化性能を向上させ、負の転送を防ぐ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。