Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reactive Planning in Dynamic Environments

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|Oct 31, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 5
ひとこと要約

本論文は、深度カメラのみを用いて動的環境において反応的計画を実行できるエンドツーエンドのディープ強化学習フレームワークを提案する。運動学的計画、ワープoin生成の教師あり学習、経路条件付き強化学習による軌道追従を組み合わせることで、シミュレーションおよび実世界の6自由度アームタスクにおいて、高いサンプル効率と新規環境への一般化性能を達成した。ランダムな障害物に対して90%の成功率を達成し、移動するゴールに対しては100%の成功率を示した。

ABSTRACT

The main novelty of the proposed approach is that it allows a robot to learn an end-to-end policy which can adapt to changes in the environment during execution. While goal conditioning of policies has been studied in the RL literature, such approaches are not easily extended to cases where the robot's goal can change during execution. This is something that humans are naturally able to do. However, it is difficult for robots to learn such reflexes (i.e., to naturally respond to dynamic environments), especially when the goal location is not explicitly provided to the robot, and instead needs to be perceived through a vision sensor. In the current work, we present a method that can achieve such behavior by combining traditional kinematic planning, deep learning, and deep reinforcement learning in a synergistic fashion to generalize to arbitrary environments. We demonstrate the proposed approach for several reaching and pick-and-place tasks in simulation, as well as on a real system of a 6-DoF industrial manipulator. A video describing our work could be found \url{https://youtu.be/hE-Ew59GRPQ}.

研究の動機と目的

  • 実行中に変化するゴールにロボットが反応的に適応できるようにすること。これは人間が持つ能力ではあるが、ロボットシステムでは容易に再現できない。
  • ゴールが明示的に提供されていないが、ビジョンによって認識されなければならない状況において、タスク実行中にゴールが変更される課題に対処すること。
  • 低コストの深度センサーを用いてリアルタイムで動作する、サンプル効率的で一般化可能なポリシーを開発すること。
  • 実世界データ収集を最小限に抑えるために、実世界からシミュレーションへの変換関数(real2sim転送関数)を用いて完全にシミュレーション内で訓練することで、シミュレーションから実世界へのギャップを埋めること。
  • 軌道計画と軌道追従を分離することで、モジュラーでスケーラブルな学習を可能にすること。

提案手法

  • オフラインのRRT*計画器が生成した軌道を用いて、教師あり学習の形で深層畳み込みニューラルネットワーク(CNN)を訓練し、深度画像から一連のワープoinを予測する。
  • 任意のワープイン列を追従するように学習する経路条件付きディープ強化学習(RL)ポリシーを採用し、効率的かつ安定した軌道追従を実現する。
  • 実世界の画像をシミュレーテッド画像にマッピングするreal2sim転送関数を用いて、シミュレーション内で強化学習ポリシーを訓練することで、効率的かつ現実的な訓練を可能にする。
  • 2段階のアーキテクチャを採用する:(1) 教師あり学習によるビジョンベースのワープイン予測、(2) RLによる反応的軌道追従。実行中にゴール状態を動的に更新する。
  • 強化学習の訓練中にカリキュラム学習を活用することで、収束性と安定性を向上させる。
  • ポリシー全体をシミュレーション内で訓練し、微調整なしに実際の6自由度産業用アームにデプロイする。

実験結果

リサーチクエスチョン

  • RQ1明示的なゴール指定なしに、動的に変化するゴールに適応できるエンドツーエンドの反応的ポリシーをロボットが学習できるか?
  • RQ2再トレーニングなしに、ビジョンベースのロボットが新規環境や障害物配置に一般化できるか?
  • RQ3経路条件付き強化学習は、複雑なロボット操作タスクにおけるサンプル効率と最終的パフォーマンスを向上させられるか?
  • RQ4real2sim転送関数は、最小限の実世界データで、効果的なシミュレーションから実世界へのポリシー移行を可能にするか?
  • RQ5軌道計画と軌道追従を分離することで、動的環境における学習の安定性と一般化性能が向上するか?

主な発見

  • 提案手法は、ランダムな障害物を伴う実世界の一般化タスクで90%の成功率を達成し、ベースライン(0%の成功率)を著しく上回った。
  • 実システムにおける移動ゴールタスクでは100%の成功率を達成し、動的ゴール変更下でも強力な反応的計画を示した。
  • 経路条件付きRLエージェントは、ワープインを用いないベースラインRLエージェントよりも収束が早く、最終的なパフォーマンスも優れており、サンプル効率が向上した。
  • RLベースの低レベルコントローラは、PIDベースラインと比較して平均的な角加速度を最大80%まで低減し、滑らかで安定した運動を実現した。
  • 提案手法は、6つのシナリオにおいて、PIDベースラインと比較してゴール到達までの時間を50%以上短縮した。実行時間は0.89–1.26秒から0.48–0.57秒に低下した。
  • シミュレーション内および実世界でのデプロイにおいて、シミュレーションから実世界への移行後、微調整なしに未確認の環境に効果的に一般化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。