Skip to main content
QUICK REVIEW

[論文レビュー] Learning sparse representations in reinforcement learning

Jacob Rafati, David C. Noelle|arXiv (Cornell University)|Sep 4, 2019
Neural dynamics and brain function参考文献 24被引用数 5
ひとこと要約

本論文では、強化学習におけるスパースで分散型の内部表現を学習するために、人工ニューラルネットワークにk-Winners-Take-All (kWTA) メカニズムを導入することを提案している。この手法は、Puddle-world、Mountain-car、Acrobot といった古典的制御タスクにおいて、標準的なバックプロパゲーションを用いた時系列差分(TD)学習が失敗する状況でも、顕著な性能向上を達成している。この方法は、側方抑制を活用して一般化とパターン分離のバランスを図り、深刻な干渉の回避を実現し、従来では到達不可能とされた環境でも学習を成功させる。

ABSTRACT

Reinforcement learning (RL) algorithms allow artificial agents to improve their selection of actions to increase rewarding experiences in their environments. Temporal Difference (TD) Learning -- a model-free RL method -- is a leading account of the midbrain dopamine system and the basal ganglia in reinforcement learning. These algorithms typically learn a mapping from the agent's current sensed state to a selected action (known as a policy function) via learning a value function (expected future rewards). TD Learning methods have been very successful on a broad range of control tasks, but learning can become intractably slow as the state space of the environment grows. This has motivated methods that learn internal representations of the agent's state, effectively reducing the size of the state space and restructuring state representations in order to support generalization. However, TD Learning coupled with an artificial neural network, as a function approximator, has been shown to fail to learn some fairly simple control tasks, challenging this explanation of reward-based learning. We hypothesize that such failures do not arise in the brain because of the ubiquitous presence of lateral inhibition in the cortex, producing sparse distributed internal representations that support the learning of expected future reward. The sparse conjunctive representations can avoid catastrophic interference while still supporting generalization. We provide support for this conjecture through computational simulations, demonstrating the benefits of learned sparse representations for three problematic classic control tasks: Puddle-world, Mountain-car, and Acrobot.

研究の動機と目的

  • Puddle-world、Mountain-car、Acrobot といった単純な制御タスクにおいて、ニューラルネットワークの関数近似を用いた時系列差分(TD)学習が失敗する問題に対処すること。
  • 皮質の側方抑制にインspiredされたスパースで結合的なニューロン表現が、深刻な干渉を防ぎ、学習安定性を向上させるかを調査すること。
  • 脳がTD学習の失敗を回避するのはアルゴリズムの変更によるのではなく、側方抑制によって実現されるスパースコーディングのおかげであるという仮説を検証すること。
  • ニューラルネットワークにk-Winners-Take-All (kWTA) メカニズムを導入することで、モデルフリー強化学習における安定な価値関数近似を可能にするスパース表現が得られるかを評価すること。
  • 標準的なバックプロパゲーションベースのネットワークが失敗する状況でも、スパース表現が成功した学習を可能にし、単純なアーキテクチャでも有効であるかを実証すること。

提案手法

  • 著者らは、隠れ層にk-Winners-Take-All (kWTA) メカニズムを組み込んだフィードフォワードニューラルネットワークを用いて、状態行動価値関数の近似器を実装した。
  • kWTA メカニズムは、入力ごとに正確にk個の活性化ニューロンを選択することで、側方抑制を模倣し、スパースで分散型の表現を促進する。
  • 学習は、経験リプレイとターゲットネットワークを用いたSARSAアルゴリズムにより実施され、価値関数はニューラルネットワークの出力によって近似された。
  • 本手法は、同一のハイパーパrameterを用いて、3つの古典的制御タスク(Puddle-world、Mountain-car、Acrobot)で評価された。
  • 性能比較は、線形(隠れ層なし)、標準的なバックプロパゲーション(通常)、kWTAベースのネットワークの3種類のネットワークタイプで実施され、学習段階とテスト段階が明確に分離された。
  • テスト段階では重みが固定され、探索は許可されず、平均TD誤差とゴール到達までのステップ数を用いて一般化性能を測定した。

実験結果

リサーチクエスチョン

  • RQ1k-Winners-Take-All (kWTA) を用いたスパース分散表現が、Puddle-world、Mountain-car、Acrobot といった単純な制御タスクでニューラルネットワークを用いたTD学習の失敗を解消できるか?
  • RQ2kWTA でモデル化された神経回路における側方抑制が、価値関数近似においてより良い一般化を実現するとともに、深刻な干渉を最小限に抑えることができるか?
  • RQ3スパース表現が、特に価値関数が非連続な環境において、モデルフリー強化学習の学習安定性と収束性を向上させるか?
  • RQ4kWTA メカニズムが、脳(例:中脳ドーパミン系)が人工ネットワークが失敗するRLタスクで成功する理由を説明できるか?
  • RQ5標準的なバックプロパゲーションネットワークとkWTAネットワークの性能差は、パターン分離の向上によるものか、一般化の向上によるものか?

主な発見

  • kWTAベースのネットワークは、Acrobot制御タスクで最適方策を正常に学習したが、線形ネットワークおよび通常のバックプロパゲーションネットワークは最適性能に収束しなかった。
  • Puddle-worldタスクでは、kWTAネットワークが通常のネットワークよりも顕著に低い平均TD誤差と少ないゴール到達ステップ数を達成した。一方、通常のネットワークは高い不安定性と収束不良を示した。
  • Mountain-carタスクでは、kWTAネットワークがより速い収束と低いTD誤差を示し、訓練実行間で一貫性のある性能を維持した。これに対して、通常のネットワークはしばしば学習に失敗した。
  • テスト結果から、訓練後も唯一kWTAネットワークのみが低いTD誤差と最小限のゴール到達ステップ数を維持しており、強固な一般化性能と安定した価値関数近似が示された。
  • 通常のバックプロパゲーションネットワークは、性能に高いばらつきを示し、頻繁に発散し、特に非線形な価値関数構造を持つタスクでは一般化性能が著しく劣っていた。
  • これらの結果は、側方抑制によって強制されるスパース表現が、高次元かつ非線形な環境における安定的かつ効果的なTD学習に不可欠であるという仮説を支持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。