Skip to main content
QUICK REVIEW

[論文レビュー] Functions that Emerge through End-to-End Reinforcement Learning - The Direction for Artificial General Intelligence -

Katsunari Shibata|arXiv (Cornell University)|Mar 7, 2017
Reinforcement Learning in Robotics参考文献 13被引用数 14
ひとこと要約

この論文は、再帰的ニューラルネットワーク(RNN)を用いたエンド・ツー・エンド強化学習(RL)が、事前に定義された機能的境界や記号的構造なしに、画像認識、記憶、注意、予測、目的指向行動といった多様で複雑な認知機能が、生のセンサ入力とモータ出力から直接生じることを示している。主な貢献は、学習が生の知覚から行動へと及ぶ際、RLによって包括的かつ柔軟な知能に類似した行動が自然に出現することを示したことであり、これは人工一般知能(AGI)への核心的アプローチであると考えられる。

ABSTRACT

Recently, triggered by the impressive results in TV-games or game of Go by Google DeepMind, end-to-end reinforcement learning (RL) is collecting attentions. Although little is known, the author's group has propounded this framework for around 20 years and already has shown various functions that emerge in a neural network (NN) through RL. In this paper, they are introduced again at this timing. "Function Modularization" approach is deeply penetrated subconsciously. The inputs and outputs for a learning system can be raw sensor signals and motor commands. "State space" or "action space" generally used in RL show the existence of functional modules. That has limited reinforcement learning to learning only for the action-planning module. In order to extend reinforcement learning to learning of the entire function on a huge degree of freedom of a massively parallel learning system and to explain or develop human-like intelligence, the author has believed that end-to-end RL from sensors to motors using a recurrent NN (RNN) becomes an essential key. Especially in the higher functions, this approach is very effective by being free from the need to decide their inputs and outputs. The functions that emerge, we have confirmed, through RL using a NN cover a broad range from real robot learning with raw camera pixel inputs to acquisition of dynamic functions in a RNN. Those are (1)image recognition, (2)color constancy (optical illusion), (3)sensor motion (active recognition), (4)hand-eye coordination and hand reaching movement, (5)explanation of brain activities, (6)communication, (7)knowledge transfer, (8)memory, (9)selective attention, (10)prediction, (11)exploration. The end-to-end RL enables the emergence of very flexible comprehensive functions that consider many things in parallel although it is difficult to give the boundary of each function clearly.

研究の動機と目的

  • 生のセンサ入力からモータ出力へのエンド・ツー・エンド強化学習(RL)が、事前に定義された機能的モジュールなしに、人間のような複雑な認知機能を生じさせることを示すこと。
  • AIで一般的な機能モジュラー化が、人工的な制約とフレーム問題をもたらし、真に柔軟かつ包括的な知能の出現を制限することを主張すること。
  • バックプロパゲーション・スルータイム(BPTT)を用いて強化学習信号で訓練される再帰的ニューラルネットワーク(RNN)が、記憶、注意、予測といった動的機能を自律的に発展させられることを示すこと。
  • エンド・ツー・エンドのRLを、入出力境界が曖昧な高次関数に特に適した人工一般知能(AGI)を達成するための必須フレームワークとして位置づけること。
  • 幅広い関数が、単純なタスクにおいても、物体追跡、選択的注意、適応的探索といった行動を観察することで、RLによって自然に出現することを実証的証拠で示すこと。

提案手法

  • エンド・ツー・エンドの強化学習を採用し、方策と価値関数として再帰的ニューラルネットワーク(RNN)を用い、スパarsな報酬信号とともにバックプロパゲーション・スルータイム(BPTT)で訓練する。
  • センサ入力として生のカメラピクセル、モータ出力として生のモータ命令を入出力空間として使用し、事前処理や手作業による特徴抽出を一切行わない。
  • 試行錯誤学習を通じて累積報酬を最大化するようにRNNを訓練し、時間的バックプロパゲーションにより記憶や予測といった動的機能が出現するようにする。
  • エージェントが内部RNN状態に基づいて行動(例:'移動' や 'キャプチャ')を選択できるアクター・クリティック構造(アクター-Q)を実装し、連続的制御と意思決定を可能にする。
  • 部分的観測(例:頻繁に見えなくなる移動物体)を含むタスクを設計し、明示的な計画や軌道生成なしに予測と適応が可能かどうかをテストする。
  • 学習の安定化と長期的信用配分を支援するために、遷移行列が単位行列に近くなるように重み初期化を行う。

実験結果

リサーチクエスチョン

  • RQ1事前に定義された機能的モジュールや記号的表現なしに、エンド・ツー・エンドのRLによって、複雑で高次の認知的機能が出現できるか?
  • RQ2再帰的ニューラルネットワークが、スパarsな報酬信号のみを用いて、動的で部分的観測可能な環境において予測・記憶・注意・行動を学習できる程度はどの程度か?
  • RQ3エンド・ツー・エンドのRL(生のセンサからモータ)は、従来のモジュラー手法と比較して、複雑な行動の学習における柔軟性と適応性においてどのように異なるか?
  • RQ4選択的注意、記憶、予測といった関数が、これらの機能に特化したアーキテクチャ設計なしに、RNNの内部ダイナミクスを通じて自然に出現できるか?
  • RQ5RNNの時間的処理能力が、明示的な世界モデルが存在しない状況で、計画や探索といった高次関数の出現をどのように支援するか?

主な発見

  • エージェントは、頻繁に見えなくなる移動物体の動きを予測し、視野の中心付近で待機して、予期しない方向転換に反応するように学習した。
  • 見えない物体を捕らえるタスクでは、エージェントが自発的に前方の範囲に移動し、待機してから再出現時に追跡・捕獲する戦略を発展させ、運動の変化に対しても適応した。
  • 目的指向的関連記憶が実現された。過去の状態が明示的な記憶モジュールなしに、将来の行動を導くために使用された。
  • 選択的注意が自然に出現した。専用の注意機構なしに、文脈に基づいて関連する画像領域に注目するようエージェントが学習した。
  • 曖昧な状況や見えないゴールの状況において、過去の経験に基づいて行動を調整する、効果的で決定論的な探索行動を示した。
  • 霊長類の脳で観察される報酬予測の期待値を示すニューロンの出現がシミュレーションで説明された。RLで訓練されたRNNが、神経生物学的現象を再現できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。