Skip to main content
QUICK REVIEW

[論文レビュー] Communications that Emerge through Reinforcement Learning Using a (Recurrent) Neural Network

Katsunari Shibata|arXiv (Cornell University)|Mar 10, 2017
Reinforcement Learning in Robotics参考文献 12被引用数 3
ひとこと要約

この論文は、再帰的ニューラルネットワーク(RNN)を用いたエンド・トゥ・エンド強化学習によって、交渉、信号の離散化、接地された通信といった多様な通信プロトコルが自然に出現することを示している。エージェントは報酬信号のみに依存して信号を生成・解釈するよう学習し、事前に定義された記号や通信ルールがなくても、衝突のないナビゲーション、ノイズ下での2値通信、および生のカメラ入力からのリアルタイムのロボット制御を達成している。

ABSTRACT

Communication is not only an action of choosing a signal, but needs to consider the context and sensor signals. It also needs to decide what information is communicated and how it is represented in or understood from signals. Therefore, communication should be realized comprehensively together with its purpose and other functions. The recent successful results in end-to-end reinforcement learning (RL) show the importance of comprehensive learning and the usefulness of end-to-end RL. Although little is known, we have shown that a variety of communications emerge through RL using a (recurrent) neural network (NN). Here, three of them are introduced. In the 1st one, negotiation to avoid conflicts among 4 randomly-picked agents was learned. Each agent generates a binary signal from the output of its recurrent NN (RNN), and receives 4 signals from the agents three times. After learning, each agent made an appropriate final decision after negotiation for any combination of 4 agents. Differentiation of individuality among the agents also could be seen. The 2nd one focused on discretization of communication signal. A sender agent perceives the receiver's location and generates a continuous signal twice by its RNN. A receiver agent receives them sequentially, and moves according to its RNN's output to reach the sender's location. When noises were added to the signal, it was binarized through learning and 2-bit communication was established. The 3rd one focused on end-to-end comprehensive communication. A sender receives 1,785-pixel real camera image on which a real robot can be seen, and sends two sounds whose frequencies are computed by its NN. A receiver receives them, and two motion commands for the robot are generated by its NN. After learning, though some preliminary learning was necessary for the sender, the robot could reach the goal from any initial location.

研究の動機と目的

  • エンド・トゥ・エンド強化学習を用いて、事前に定義された記号や通信アーキテクチャがなくても、包括的な通信が出現するかどうかを調査すること。
  • 報酬ベースの学習によって、エージェントが交渉・信号の離散化・センサーモータ的タスクにおける通信の接地をどのように学習できるかを調査すること。
  • 報酬信号のみを用いて、動的で現実に近い環境で通信プロトコルが自律的に学習可能であることを示すこと。
  • RNNが強化学習下で自己組織化によって構造的で目的を持つ通信が出現することを支援できることを示すこと。
  • エンド・トゥ・エンド強化学習を用いて、生のカメラ画像から音声信号を生成し、目的指向ナビゲーションに使用する、最初の実世界のロボットシステムを確立すること。

提案手法

  • エージェントは、センサ入力と内部状態に基づいて、再帰的ニューラルネットワーク(RNN)を用いて通信信号を生成・処理する。
  • 通信は、独立的かつ分散型の強化学習(アドバイザー・クリティックフレームワーク)によって学習され、報酬はエピソード終了時にのみ与えられる。
  • 交渉タスクでは、3ラウンドにわたって二値信号を交換することで、経路選択を調整し、衝突を回避する。
  • 信号の離散化では、訓練中にノイズを導入することで、RNN出力が安定した2ビットの二値信号へ自己組織化する。
  • 接地通信では、生の1,785ピクセルのカメラ画像が送信者のRNNによって2つの音周波数にマッピングされ、受信者のRNNがそれらを受信・復号してロボットの運動命令を生成する。
  • 直接的なロボット制御の予備学習を用いて送信者のネットワーク重みを初期化することで、実世界のロボット設定において通信学習が成功するようになっている。

実験結果

リサーチクエスチョン

  • RQ1複数のエージェント間での交渉が、事前に定義された通信プロトコルがなくてもエンド・トゥ・エンド強化学習によって出現するか。
  • RQ2ノイズのある条件下で、連続的通信信号が強化学習によって自己組織化し、離散的で頑健な信号に進化するか。
  • RQ3生のセンサ入力(例:カメラ画像)から出発して、意味的で目的を持つ通信が出現し、実際のロボット制御に使用可能か。
  • RQ4RNNが明示的な記号的・構造的事前知識なしに、構造的で機能的な通信の出現をどの程度支援できるか。
  • RQ5監視や事前に定義された信号の意味なしに、報酬設計のみで通信プロトコルを学習できるか。

主な発見

  • 交渉タスクでは、任意のエージェントの組み合わせに対しても、3ラウンドの二値信号交換により衝突を回避し、非衝突経路を選択することができた。
  • 訓練中にノイズを導入した結果、RNNは二値信号へ自己組織化し、受信者の位置を伝える安定した2ビット通信プロトコルが出現した。
  • 学習後、受信者は任意の初期位置から1ステップで目標に到達でき、通信プロトコルが頑健で機能的であることが示された。
  • 接地通信タスクでは、送信者が生のカメラ画像から音声信号を生成し、受信者がリアルタイムの音声入力を受信してロボットを目標へ誘導することができた。
  • エンド・トゥ・エンド強化学習のみを用いてロボットナビゲーションを成功させ、送信者のRNNが事前に記号的マッピングなしに空間的情報を周波数に符号化するよう学習した。
  • 直接制御学習からの事前学習重みの使用により、実世界のロボット設定における通信学習の収束性と成功確率が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。