Skip to main content
QUICK REVIEW

[論文レビュー] Example-Driven Model-Based Reinforcement Learning for Solving Long-Horizon Visuomotor Tasks

Bo-Han Wu, Suraj Nair|arXiv (Cornell University)|Jun 19, 2021
Reinforcement Learning in Robotics被引用数 1
ひとこと要約

EMBR は、学習されたダイナミクスモデル、コーチネットワーク、成功分類器を用いて、rawな画像からビジュオモータープリミティブスキルのレパートリーを学習するモデルベース強化学習手法であり、長時間スケールのタスクを堅牢に逐次実行可能である。複雑なデスク整理タスク(最大12のスキル、14の異なるプリミティブを要する)において85%の成功率を達成し、未学習の物体に対しても一般化可能である。

ABSTRACT

In this paper, we study the problem of learning a repertoire of low-level skills from raw images that can be sequenced to complete long-horizon visuomotor tasks. Reinforcement learning (RL) is a promising approach for acquiring short-horizon skills autonomously. However, the focus of RL algorithms has largely been on the success of those individual skills, more so than learning and grounding a large repertoire of skills that can be sequenced to complete extended multi-stage tasks. The latter demands robustness and persistence, as errors in skills can compound over time, and may require the robot to have a number of primitive skills in its repertoire, rather than just one. To this end, we introduce EMBR, a model-based RL method for learning primitive skills that are suitable for completing long-horizon visuomotor tasks. EMBR learns and plans using a learned model, critic, and success classifier, where the success classifier serves both as a reward function for RL and as a grounding mechanism to continuously detect if the robot should retry a skill when unsuccessful or under perturbations. Further, the learned model is task-agnostic and trained using data from all skills, enabling the robot to efficiently learn a number of distinct primitives. These visuomotor primitive skills and their associated pre- and post-conditions can then be directly combined with off-the-shelf symbolic planners to complete long-horizon tasks. On a Franka Emika robot arm, we find that EMBR enables the robot to complete three long-horizon visuomotor tasks at 85% success rate, such as organizing an office desk, a file cabinet, and drawers, which require sequencing up to 12 skills, involve 14 unique learned primitives, and demand generalization to novel objects.

研究の動機と目的

  • 長時間スケールのタスクに対して、堅牢で再利用可能な低レベルビジュオモータースキルのレパートリーを学習すること。
  • 継続的な成功モニタリングを通じて、エラーおよび環境の摂動に強く、失敗に耐性のあるスキルの順序実行を可能にすること。
  • 全スキルのデータを用いて、タスクに依存しないダイナミクスモデルを訓練することで、サンプル効率と一般化性能を向上させること。
  • 学習済みスキルをシンボリックプランナと統合し、現実世界環境における高レベルのタスク実行を可能にすること。
  • 未学習の物体や動的状況を含む、複雑なマルチステージビジュオモータータスクにおいて高い成功率を達成すること。

提案手法

  • EMBR は、モデルベース強化学習フレームワークにおいて、スキル実行の結果を予測するための学習済みダイナミクスモデルを採用している。
  • コーチネットワークは、スキルポリシーの品質を評価し、学習中にポリシー改善の信号を提供する。
  • 成功分類器は、密な報酬関数として機能し、スキルが成功したか失敗したかを継続的にモニタリングする。これにより、再試行メカニズムが可能になる。
  • 成功分類器により、スキルが現実世界の状態に適応され、失敗を検知し、摂動下でも再試行をトリガーできる。
  • ダイナミクスモデルは、全スキルをカバーする多様なデータセット上で訓練されており、タスクに依存せず、異なる長時間スケールタスクに再利用可能である。
  • 事前・事後条件を伴う学習済みビジュオモータープリミティブは、市販のシンボリックプランナと組み合わせられ、複雑なマルチステージタスクを解決する。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習フレームワークは、未学習の物体に一般化可能な、rawな画像から多様なビジュオモータースキルのレパートリーを学習できるか?
  • RQ2摂動や失敗が発生した場合でも、スキルの成功状態を継続的にモニタリングし、再試行可能にする方法は何か?
  • RQ3複数のスキルのデータを用いて、1つのタスクに依存しないダイナミクスモデルを効果的に訓練できるか?
  • RQ4学習済みスキルをどの程度、シンボリックプランナと組み合わせて、長時間スケールのマルチステージタスクを解けるか?
  • RQ5このようなシステムは、最大12の順次スキルを含む、複雑な現実世界のビジュオモータータスクにおいて、どの程度の成功率を達成できるか?

主な発見

  • EMBR は、デスク整理、ファイルキャビネット管理、ドアマンプレーションを含む3つの長時間スケールビジュオモータータスクにおいて、85%の成功率を達成した。
  • システムは、タスク間で最大12の異なるスキルを順序正しく実行し、スキルの組み合わせにおけるスケーラビリティを示した。
  • 本手法は14のユニークな学習済ビジュオモータープリミティブを必要とし、それぞれが成功分類器によって現実世界の状態に根ざしており、堅牢な実行を可能にした。
  • タスクに依存しないダイナミクスモデルにより、共有データを用いた多様なスキルにおける効率的な学習が可能になった。
  • フレームワークは、トレーニング時に見未曾る物体に対しても一般化可能であり、強力な一般化能力を示した。
  • 学習済みスキルとシンボリックプランナの統合により、複雑なマルチステージ手順の信頼性ある実行が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。