Skip to main content
QUICK REVIEW

[論文レビュー] Safety Augmented Value Estimation from Demonstrations (SAVED): Safe Deep Model-Based RL for Sparse Cost Robotic Tasks

Brijen Thananjeyan, Ashwin Balakrishna|arXiv (Cornell University)|May 31, 2019
Reinforcement Learning in Robotics参考文献 52被引用数 8
ひとこと要約

SAVEDは、部分的に最適でないデモと確率的制約の強制を活用することで、報酬がスパarsityで制約が複雑なロボットタスクにおける安全でサンプル効率の良い学習を可能にする深層モデルベース強化学習アルゴリズムである。実世界の手術用キノウタイングタスクにおいて1時間未満で75%を超える成功確率を達成し、成功確率、制約満たし、サンプル効率の点で最先端のベースラインを上回った。

ABSTRACT

Reinforcement learning (RL) for robotics is challenging due to the difficulty in hand-engineering a dense cost function, which can lead to unintended behavior, and dynamical uncertainty, which makes exploration and constraint satisfaction challenging. We address these issues with a new model-based reinforcement learning algorithm, Safety Augmented Value Estimation from Demonstrations (SAVED), which uses supervision that only identifies task completion and a modest set of suboptimal demonstrations to constrain exploration and learn efficiently while handling complex constraints. We then compare SAVED with 3 state-of-the-art model-based and model-free RL algorithms on 6 standard simulation benchmarks involving navigation and manipulation and a physical knot-tying task on the da Vinci surgical robot. Results suggest that SAVED outperforms prior methods in terms of success rate, constraint satisfaction, and sample efficiency, making it feasible to safely learn a control policy directly on a real robot in less than an hour. For tasks on the robot, baselines succeed less than 5% of the time while SAVED has a success rate of over 75% in the first 50 training iterations. Code and supplementary material is available at https://tinyurl.com/saved-rl.

研究の動機と目的

  • 報酬信号がスパarsityで制約が複雑なロボット制御における安全でサンプル効率の良いポリシーの学習に課題に取り組むこと。
  • 設計が困難で、望ましくない行動を引き起こす可能性がある手作業で設計された密度の高いコスト関数への依存を減らすこと。
  • データ収集が限られている高リスク分野(例:手術)において、特にリアルロボット上で効率的かつ安全にポリシーを学習できること。
  • デモをシグナルとして用いて、エージェントがタスク完了に自信を持つ領域に探索を制約することで、探索を改善すること。
  • 動的不確実性下でも、学習されたダイナミクスモデルからの不確実性推定値を用いて、非凸な状態空間制約を強固に強制すること。

提案手法

  • SAVEDは、スパースコスト環境における遅延報酬信号を提供するために、少量の部分的に最適なデモを活用し、密度の高い手作業で設計されたコスト関数を置き換える。
  • エージェントがタスク完了に自信を持つ領域に探索を制約する安全拡張価値推定機構を導入し、デモの質に基づく。
  • 学習されたダイナミクスモデルからの不確実性推定値を用いて確率的チャンス制約を強制し、モデル不確実性下でも強固な制約満たしを実現する。
  • 各ステップで制約付き計画問題を解くために、モデル予測制御(MPC)フレームワークと交差エントロピー法(CEM)最適化を採用する。
  • 経験からダイナミクスモデルを学習し、デモベースの監視と制約を考慮した計画を組み合わせてポリシーを改善することで、反復的にポリシーを向上させる。
  • 非凸で複雑な状態空間制約を扱える確率的制約の定式化を採用し、探索中に安全を維持する。

実験結果

リサーチクエスチョン

  • RQ1密度の高い手作業で設計されたコスト関数に依存せずに、報酬がスパarsityで制約が複雑な環境において、深層モデルベース強化学習アルゴリズムが効率的かつ安全に学習できるか。
  • RQ2部分的に最適なデモをどのように効果的に活用し、報酬がスパarsityのロボットタスクにおける探索のガイドとし、サンプル効率を向上させられるか。
  • RQ3モデルの不確実性推定値を用いた確率的制約強制は、高次元かつ動的不確実性が大きいロボットシステムにおける制約満たしを改善できるか。
  • RQ4このような手法は、データ収集時間が限られ、安全要件が高いリアルロボットに、どの程度直接適用可能か。
  • RQ5標準のモデルフリーまたはモデルベースのベースラインと比較して、タスク完了に対するデモベースの自信を統合することで、ポリシー学習がどの程度向上するか。

主な発見

  • SAVEDは、物理的なda Vinci手術用ロボットにおいて、50回の訓練反復で75%を超える成功確率を達成した一方、ベースラインは1回の試行で5%未満の成功率にとどまった。
  • キノウタイングタスクの学習済みポリシーは、デモの平均反復コストを34.4から21.9に低下させ、最大コストも25にまで抑え、顕著な性能向上を示した。
  • 6つのシミュレーションベンチマークにおいて、SAVEDは3つの最先端のモデルフリーおよびモデルベース強化学習ベースラインを、成功確率および制約満たしの両面で上回った。
  • 実ロボット上でSAVEDを直接訓練したところ、50反復で約1時間で完了し、実世界への実用的適合性を示した。
  • PETSfDは高い制約満たしを維持したが、タスク成功に至らなかった。一方、SACfDは頻繁に制約を違反し、一度も成功しなかった。これにより、SAVEDの安全性と性能の優れたバランスが示された。
  • この手法により一貫性のある実行が可能となり、トレーニング後、SAVEDは20回中20回の試行でキノウタイングを成功させ、高い信頼性と耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。