Skip to main content
QUICK REVIEW

[論文レビュー] Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning

Wenbin Li, Jeannette Bohg|arXiv (Cornell University)|Nov 1, 2017
Reinforcement Learning in Robotics参考文献 22被引用数 3
ひとこと要約

本稿では、ポリシー・ネットワークにゴール状態を直接組み込むことで、物理シミュレーテッド環境でブロック積みスキルを学習できるようにする、ゴールパrameterized深層強化学習(GDQN)を提案する。標準DQNと比較して、多様なターゲット構造において優れた汎化性能を達成し、4ブロックタスクでは成功確率が0.00から0.17に向上し、報酬形状化を用いることでオーバーラップ比は0.79に達する。

ABSTRACT

Understanding physical phenomena is a key component of human intelligence and enables physical interaction with previously unseen environments. In this paper, we study how an artificial agent can autonomously acquire this intuition through interaction with the environment. We created a synthetic block stacking environment with physics simulation in which the agent can learn a policy end-to-end through trial and error. Thereby, we bypass to explicitly model physical knowledge within the policy. We are specifically interested in tasks that require the agent to reach a given goal state that may be different for every new trial. To this end, we propose a deep reinforcement learning framework that learns policies which are parametrized by a goal. We validated the model on a toy example navigating in a grid world with different target positions and in a block stacking task with different target structures of the final tower. In contrast to prior work, our policies show better generalization across different goals.

研究の動機と目的

  • 物理的モデルを明示的に記述せずに、試行錯誤による学習によってアーティフィシャルエージェントが物理的相互作用スキルを自律的に学習することを目的とする。
  • ブロックを異なるターゲット構成に積み上げるような操作タスクにおいて、変化するゴール状態にわたるポリシーの汎化を解決することを目的とする。
  • ゴール情報をポリシー・ネットワークに直接統合する深層強化学習フレームワークを構築することを目的とする。
  • 本フレームワークを、グリッドワールドナビゲーションタスクと、多様なターゲット構造を持つ複雑なブロック積みタスクの両方で検証することを目的とする。

提案手法

  • 本稿では、現在の状態とゴール埋め込みを入力として受け取り、アクション方策を出力するゴールパrameterized深層Qネットワーク(GDQN)を導入する。
  • ゴールはベクトルとして符号化され、観測状態と連結されて、特定のターゲット構成に向けてポリシーを誘導する。
  • 経験再生とターゲットネットワークを用いる深層強化学習を採用し、DQNと同様のアーキテクチャを採用するが、ゴール条件付き学習を扱えるように拡張する。
  • 学習効率と最終的なパフォーマンスを向上させるために、オーバーラップ比と距離変換を用いた報酬形状化を適用する。
  • 物理的ダイナミクスを備えたシミュレーテッド環境で、エンドツーエンドにモデルを訓練する。
  • 訓練プロセスには、エプソン・グリーディ探索とその徐々な減少、および20万ステップのリプレイバッファが含まれる。

実験結果

リサーチクエスチョン

  • RQ11つの深層強化学習ポリシーが、ブロック積みタスクにおいて複数の異なるゴール状態に一般化できるか?
  • RQ2ポリシー・ネットワークにゴール情報を統合することで、標準DQNと比較して汎化性能がどのように向上するか?
  • RQ3オーバーラップ比と距離変換を用いた報酬形状化は、ポリシーのパフォーマンスとサンプル効率をどの程度向上させるか?
  • RQ4提案されたゴールパrameterizedフレームワークは、ブロック数の増加に伴い、より複雑なターゲット構造に対しても効果的に一般化できるか?

主な発見

  • 5×5グリッドワールドナビゲーションタスクでは、GDQNはDQNの0.67と比較して0.97の成功確率を達成し、ランダムな開始位置とゴール位置において強力な汎化性能を示した。
  • 2ブロック積みでは、GDQNは0.72の成功確率と0.82のオーバーラップ比を達成し、DQNの0.70の成功確率と0.70のオーバーラップ比を顕著に上回った。
  • 4ブロック積みでは、DQNは完全に失敗し、成功確率が0.00、オーバーラップ比が0.03であったが、GDQNは成功確率0.17、オーバーラップ比0.41を達成した。
  • 距離変換を用いた報酬形状化により、GDQNは4ブロックタスクで成功確率0.56、オーバーラップ比0.79を達成し、形状化なしのGDQNと比較して顕著な向上を示した。
  • タスクの複雑さが増すにつれて、DQNとGDQNのパフォーマンスギャップが広がり、GDQNのより優れた汎化能力が示された。
  • 結果から、ゴールパrameterized学習により、ブロック数の増加に伴っても、多様なターゲット構造を効果的に処理できる1つのポリシーが実現可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。