Skip to main content
QUICK REVIEW

[論文レビュー] ROBEL: Robotics Benchmarks for Learning with Low-Cost Robots

Michael J. Ahn, Henry Zhu|arXiv (Cornell University)|Sep 25, 2019
Reinforcement Learning in Robotics参考文献 37被引用数 11
ひとこと要約

ROBELは、低コストでモジュラーなロボット—D'Claw(9自由度の操作)とD'Kitty(12自由度の歩行)—のオープンソースプラットフォームを提供する。これらは現実世界における強化学習を目的として設計されており、密度の高い/希釈された目的関数と安全メトリクスを備え、再現可能でハードウェアに安全な学習を可能にしている。これにより、14,000時間を超える現実世界での学習が実現され、独立に構築されたロボット間でのポリシー再現が達成された。

ABSTRACT

ROBEL is an open-source platform of cost-effective robots designed for reinforcement learning in the real world. ROBEL introduces two robots, each aimed to accelerate reinforcement learning research in different task domains: D'Claw is a three-fingered hand robot that facilitates learning dexterous manipulation tasks, and D'Kitty is a four-legged robot that facilitates learning agile legged locomotion tasks. These low-cost, modular robots are easy to maintain and are robust enough to sustain on-hardware reinforcement learning from scratch with over 14000 training hours registered on them to date. To leverage this platform, we propose an extensible set of continuous control benchmark tasks for each robot. These tasks feature dense and sparse task objectives, and additionally introduce score metrics as hardware-safety. We provide benchmark scores on an initial set of tasks using a variety of learning-based methods. Furthermore, we show that these results can be replicated across copies of the robots located in different institutions. Code, documentation, design files, detailed assembly instructions, final policies, baseline details, task videos, and all supplementary materials required to reproduce the results are available at www.roboticsbenchmarks.org.

研究の動機と目的

  • シミュレーションと現実世界の強化学習のギャップを埋えるために、スケーラブルで低コストな現実世界での学習を可能にすること。
  • 壊れやすく保守が大変な高価な産業用ロボットの限界を克服し、試行錯誤学習に不適切な問題を解決すること。
  • 長期間にわたるデバイス内での強化学習実験を支援する、堅牢でモジュラーかつ容易に再現可能なハードウェアプラットフォームを提供すること。
  • 物理的制約を尊重し、損傷リスクを低減する学習手法を促進するためのハードウェア安全性メトリクスを導入すること。
  • 直接的な協力なしに、同一のロボットコピー間で跨施設での強化学習ポリシーの再現を可能にすること。

提案手法

  • D'Claw(3本指ハンド)による機敏な操作とD'Kitty(4本足)による敏捷な歩行を目的とした、低コストでモジュラーな2種類のロボットの設計とリリース。
  • 各ロボットに対して、密度の高いおよび希釈された報酬関数を備えた連続制御ベンチマークタスクのセットを実装。
  • 軌道全体にわたる位置、速度、トルクの違反を追跡するハードウェア安全性目的を統合し、リスクを定量化。
  • 現実世界のダイナミクスを忠実に再現しながら、迅速なポリシープロトタイピングのためのシミュレーテッドバックエンドを統合。
  • コード、設計図、組立手順、トレーニング済みポリシー、ベースライン結果のオープンソース化により、完全な再現性を確保。
  • モジュラーなハードウェア設計により、故障した部品(例:モーター)の容易な交換と長期的な実験を支援。

実験結果

リサーチクエスチョン

  • RQ1低コストでモジュラーなロボットは、顕著な劣化を伴わずに14,000時間を超える現実世界での強化学習を継続できるか?
  • RQ2ROBELロボットの1つのコピーで学習したポリシーが、物理的に同一のコピー(60マイル離れた場所に存在)で成功裏に再現可能か、その程度はいかほどか?
  • RQ3ハードウェア安全性メトリクスは、強化学習の学習中に危険な行動を特定・定量化するのにどの程度有効か?
  • RQ4SAC、DAPG、BC、NPGなどの多様な学習ベースの手法が、標準化されたベンチマークタスクにおいて、実機上で一貫したパフォーマンスを発揮できるか?
  • RQ5高価な産業用システムと比較して、ROBELプラットフォームは現実世界の強化学習研究への参入障壁をどの程度低減するか?

主な発見

  • ROBELロボットは14,000時間を超える現実世界での学習を蓄積し、長期的なハードウェアの耐久性と信頼性を実証した。
  • 1台のD'Clawロボットで学習したポリシーが、60マイル離れた物理的に同一のコピーで成功裏に再現された。跨施設再現性が確認された。
  • 安全メトリクスは、タスクに成功したポリシーですら、しばしば顕著な関節位置・速度・トルク違反を経験していることを明らかにした。これにより、明示的な安全制約の必要性が強調された。
  • 摩耗はネジの緩みや時折発生するモーターの故障に限定され、モジュラー設計のおかげで容易に修理可能であった。
  • SAC、DAPG、BC、NPG手法を用いたベンチマーク結果は、将来の多様な学習アルゴリズム間の比較のための標準ベースラインを提供した。
  • プラットフォームは、最小限の人的監視で、一貫性があり、スケーラブルで安全な現実世界の強化学習実験を可能にし、高価なインfra構築に依存するのを減らした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。