Skip to main content
QUICK REVIEW

[論文レビュー] Physically Embedded Planning Problems: New Challenges for Reinforcement Learning

Mehdi Mirza, Andrew Jaegle|arXiv (Cornell University)|Sep 11, 2020
Reinforcement Learning in Robotics参考文献 76被引用数 6
ひとこと要約

本稿では、物理エンジン内にソコバン、タートルチックタック、ゴーといった古典的ボードゲームをシミュレートすることで、物理的に埋め込まれた計画問題を提示する。エージェントは抽象的な手を実行するためにセンサモータ制御を必要とする。抽象的バージョンでは高いパフォーマンスを示すが、視認、長時間スケールの推論、モータ制御の複合的課題に直面する標準的な深層強化学習エージェントは困難を示し、現在のRL手法に、抽象的計画と身体的制御を橋渡しする新しい技術が不可欠であるという重要なギャップを露呈している。

ABSTRACT

Recent work in deep reinforcement learning (RL) has produced algorithms capable of mastering challenging games such as Go, chess, or shogi. In these works the RL agent directly observes the natural state of the game and controls that state directly with its actions. However, when humans play such games, they do not just reason about the moves but also interact with their physical environment. They understand the state of the game by looking at the physical board in front of them and modify it by manipulating pieces using touch and fine-grained motor control. Mastering complicated physical systems with abstract goals is a central challenge for artificial intelligence, but it remains out of reach for existing RL algorithms. To encourage progress towards this goal we introduce a set of physically embedded planning problems and make them publicly available. We embed challenging symbolic tasks (Sokoban, tic-tac-toe, and Go) in a physics engine to produce a set of tasks that require perception, reasoning, and motor control over long time horizons. Although existing RL algorithms can tackle the symbolic versions of these tasks, we find that they struggle to master even the simplest of their physically embedded counterparts. As a first step towards characterizing the space of solution to these tasks, we introduce a strong baseline that uses a pre-trained expert game player to provide hints in the abstract space to an RL agent's policy while training it on the full sensorimotor control task. The resulting agent solves many of the tasks, underlining the need for methods that bridge the gap between abstract planning and embodied control. See illustrating video at https://youtu.be/RwHiHlym_1k.

研究の動機と目的

  • エージェントが抽象的環境では優れたパフォーマンスを示すが、物理的に根ざした長時間スケールの計画タスクでは失敗するという強化学習におけるギャップを解消すること。
  • 高レベルの記号的推論と低レベルのセンサモータ制御を統合したベンチマークを提供し、現実世界の身体的知能の課題を模擬すること。
  • 標準的な深層RLアルゴリズムが、抽象的対応版で成功しているにもかかわらず、古典的計画ゲームの物理的埋め込みバージョンでは失敗することを示すこと。
  • 抽象的計画と身体的制御を橋渡しする手法を開発するためのテストベッドを提供し、オープンソースのシミュレーション環境を用いること。
  • 長時間スケールの制御タスクにおいて、構造的知識、階層的計画、内発的探索を統合する技術の研究を促すこと。

提案手法

  • ソコバン、タートルチックタック、ゴーといった記号的計画タスクを物理エンジンに埋め込み、9自由度のロボットアームを用いて物理的ゲームピeceを操作させる。
  • エゴセントリックカメラ入力を用いた視覚ベースの観測空間を採用し、現実世界の視認制約を模擬する。
  • 標準的な深層Qネットワーク(DQN)またはアクタクリティックアーキテクチャを用いて方策学習を実施し、物理シミュレーション内で試行錯誤によって訓練する。
  • 事前に訓練されたエキスパートゲームプレーヤーが抽象的ヒント(例:最適手)を提供する強力なベースラインを導入し、センサモータ空間における方策の学習を支援する。
  • カリキュラム学習を適用し、最初は単純なタスク(タートルチックタック)から始め、徐々に複雑なタスク(ゴー)へと進める。物理的制御の要求が高まるように設計する。
  • MuJoGo(7×7ゴー)では固定強度の相手を採用し、学習進捗を相手の強さから分離することで、サンプル効率と収束性の評価を可能にする。

実験結果

リサーチクエスチョン

  • RQ1標準的な深層強化学習エージェントは、長時間スケールにわたり正確なモータ制御を要する物理的埋め込みバージョンの古典的計画ゲーム(例:ゴー、ソコバン)を解けるか?
  • RQ2エキスパートゲームプレーヤーによる抽象的計画知識の統合は、センサモータ制御タスクにおけるサンプル効率とパフォーマンスをどのように向上させるか?
  • RQ3エンドツーエンドのRLが物理的根拠のある、時間的に延長された計画問題において失敗する主な原因は何か?また、それらが示す構造的制限とは何か?
  • RQ4真のゲーム状態といった特権情報が欠如している状況は、抽象的バージョンと比較して、これらの環境での学習をどの程度妨げるか?
  • RQ5抽象的計画タスクと物理的埋め込み計画タスクの間のパフォーマンスギャップを埋めるために、どのような新しい手法的要素が必要か?

主な発見

  • 標準的な深層強化学習エージェントは、抽象的バージョンで成功しているにもかかわらず、物理的埋め込みバージョンのタートルチックタックやゴーでは、基本的なゲームプレイでさえ学習できない。
  • MuJoGo(7×7ゴー)におけるバニラDQNエージェントは、数十億ステップの訓練後でも1000試合あたり1勝未満にとどまり、極めて低いサンプル効率であることが示された。
  • 事前に訓練されたエキスパートゲームプレーヤーを統合したエージェントは、400万試合の訓練後、約60%の勝率を達成した。これは、抽象的知識が学習を支援するが、それだけでは不十分であることを示している。
  • 抽象的タスクと物理的埋め込みタスクの間のパフォーマンスギャップは顕著であり、小さなボードや弱い相手でも、視認、制御、長時間スケールの推論の統合的課題が根本的な障壁を示している。
  • 結果から、現在のRLアルゴリズムは、マルチスケールの推論と制御を効果的に連携するメカニズムを欠いていることが示唆され、階層的計画と構造的監視を統合する新しい手法の必要性が明らかになった。
  • オープンソース化された環境は、既存のベンチマークが短期的・反応的制御を好む傾向にあり、現実世界の身体的意思決定の複雑さを捉えていないことを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。