Skip to main content
QUICK REVIEW

[論文レビュー] New Reinforcement Learning Using a Chaotic Neural Network for Emergence of "Thinking" - "Exploration" Grows into "Thinking" through Learning -

Katsunari Shibata, Yuki Goto|arXiv (Cornell University)|May 16, 2017
Neural Networks and Applications参考文献 5被引用数 6
ひとこと要約

本稿では、外部のランダムネスを用いずに、内部のカオス的ダイナミクスが探索を生成する、カオス的ニューラルネットワーク(ChNN)を用いた新たな強化学習フレームワークを提案する。このフレームワークにより、学習された合理的な遷移が生じ、『思考』に類似した行動が可能となる。重みの更新には因果トレースと時系列差分誤差(TD誤差)を用い、2次元ロボットタスクにおいて障害物回避の学習に成功し、より優れた探索行動と自発的な目的指向的行動が顕在化した。

ABSTRACT

Expectation for the emergence of higher functions is getting larger in the framework of end-to-end reinforcement learning using a recurrent neural network. However, the emergence of "thinking" that is a typical higher function is difficult to realize because "thinking" needs non fixed-point, flow-type attractors with both convergence and transition dynamics. Furthermore, in order to introduce "inspiration" or "discovery" in "thinking", not completely random but unexpected transition should be also required. By analogy to "chaotic itinerancy", we have hypothesized that "exploration" grows into "thinking" through learning by forming flow-type attractors on chaotic random-like dynamics. It is expected that if rational dynamics are learned in a chaotic neural network (ChNN), coexistence of rational state transition, inspiration-like state transition and also random-like exploration for unknown situation can be realized. Based on the above idea, we have proposed new reinforcement learning using a ChNN as an actor. The positioning of exploration is completely different from the conventional one. The chaotic dynamics inside the ChNN produces exploration factors by itself. Since external random numbers for stochastic action selection are not used, exploration factors cannot be isolated from the output. Therefore, the learning method is also completely different from the conventional one. At each non-feedback connection, one variable named causality trace takes in and maintains the input through the connection according to the change in its output. Using the trace and TD error, the weight is updated. In this paper, as the result of a recent simple task to see whether the new learning works or not, it is shown that a robot with two wheels and two visual sensors reaches a target while avoiding an obstacle after learning though there are still many rooms for improvement.

研究の動機と目的

  • 『思考』の顕在を解決することを目的とし、インスピレーションに類似したダイナミクスを示す合理的で多段階の状態遷移を定義する。
  • 従来の強化学習が探索に外部のランダムノイズに依存し、収束性と遷移ダイナミクスの両立に困難を抱えるという限界を克服すること。
  • 再帰的ニューラルネットワークにおけるカオス的イタinerancyを活用し、計画や発見といった高次認知機能の顕在を可能にすること。
  • 探索、学習、合理的意思決定を統合した一貫性のある決定論的フレームワーク内に、学習メカニズムを構築すること。

提案手法

  • アクター・クリティック構造としてカオス的ニューラルネットワーク(ChNN)を用い、内部のカオス的ダイナミクスにより外部ノイズを用いずに自然に探索を生成する。
  • 各接続に因果トレース $ C_{ji} $ を導入し、入力-出力関係を追跡する。出力の変化に基づき更新され、$ C^{[l]}_{ji,t} = (1 - | abla x^{[l]}_{j,t}|)C^{[l]}_{ji,t-1} + abla x^{[l]}_{j,t} x^{[l-1]}_{i,t} $ と表される。
  • 重みの更新には時系列差分(TD)誤差と因果トレースを用いる:$ abla w^{[l]}_{ji,t} = heta \cdot \hat{r}_t \cdot C^{[l]}_{ji,t} $、ここで $ \theta $ は学習率。
  • クリティックネットワークは価値関数を推定し、アクター・ネットワークは内部のChNNダイナミクスに基づいて行動を生成する。
  • 学習後も正のリャプノフ指数により、カオス的挙動が維持されていることが確認された。
  • 出力とは分離しない探索が実現されており、ChNNのダイナミクスから自然に、合理的な状態と探索的状態との間で適応的遷移が可能となっている。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワーク内の内部的カオス的ダイナミクスが、合理的で多段階の状態遷移といった『思考』行動の顕在を可能にするか。
  • RQ2探索を学習プロセスに統合することで、外部から注入されるのではなく、構造的で目的指向的な行動に進化するか。
  • RQ3因果トレースが非線形でカオス的なシステムにおいて、入力-出力の依存関係を的確に捉え、強化学習における責任帰属(クレジット・アサインメント)に有効に機能するか。
  • RQ4学習中にシステムがどの程度カオス的ダイナミクスを維持しているか、またその維持が行動の適応性にどのように影響するか。
  • RQ5因果トレースとTD誤差に基づく決定論的学習ルールが、複雑なナビゲーションタスクにおいて、従来の確率的探索を上回る性能を示せるか。

主な発見

  • ロボットは20×20のフィールド内で障害物を避けながら目的に到達する能力を学習し、複雑な環境下での効果的なナビゲーションを実現した。
  • 目的到達までの平均ステップ数がエピソードを経て減少し、効果的な学習とポリシー性能の向上を示した。
  • 学習に伴い探索行動が自動的に減少したため、減衰する探索率に依存せず、合理的な行動が内部に内化されたことが示唆された。
  • アクター・ネットワークのニューロン活性化は一様ではなく、多くのニューロンが±0.5に飽和しており、強力で構造的なダイナミクスが存在することを示した。
  • リャプノフ指数は正の値(0.0以上)を維持しており、学習中もカオス的性質が保持されていることが確認され、継続的な探索と適応性の支えとなった。
  • 環境条件が変化した際、リャプノフ指数が 再び上昇したため、カオス的ダイナミクスの再活性化が確認され、未知の状況への適応を支援する可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。