Skip to main content
QUICK REVIEW

[論文レビュー] DeXtreme: Transfer of Agile In-hand Manipulation from Simulation to Reality

Ankur Handa, Arthur Allshire|arXiv (Cornell University)|Oct 25, 2022
Robot Manipulation and Learning被引用数 5
ひとこと要約

この論文では、RGBカメラとシミュレーションから現実への転送のみを用いて、低価格なAllegroハンドを用いた俊敏なインハンド操作を可能にする視覚ベースの強化学習システムDeXtremeを提示する。Isaac Gymにおける完全微分可能でドメインランダム化されたシミュレーションパイプラインを用い、8枚のA40 GPUでのみ、オブジェクトの再方向転置タスクで最先端の性能を達成しており、特権付きモーションキャプチャベースラインと同等の結果を示している。

ABSTRACT

Recent work has demonstrated the ability of deep reinforcement learning (RL) algorithms to learn complex robotic behaviours in simulation, including in the domain of multi-fingered manipulation. However, such models can be challenging to transfer to the real world due to the gap between simulation and reality. In this paper, we present our techniques to train a) a policy that can perform robust dexterous manipulation on an anthropomorphic robot hand and b) a robust pose estimator suitable for providing reliable real-time information on the state of the object being manipulated. Our policies are trained to adapt to a wide range of conditions in simulation. Consequently, our vision-based policies significantly outperform the best vision policies in the literature on the same reorientation task and are competitive with policies that are given privileged state information via motion capture systems. Our work reaffirms the possibilities of sim-to-real transfer for dexterous manipulation in diverse kinds of hardware and simulator setups, and in our case, with the Allegro Hand and Isaac Gym GPU-based simulation. Furthermore, it opens up possibilities for researchers to achieve such results with commonly-available, affordable robot hands and cameras. Videos of the resulting policy and supplementary information, including experiments and demos, can be found at https://dextreme.org/

研究の動機と目的

  • 最小限のハードウェアとインfrastrctureで、シミュレーションから現実世界のロボットハンドへのデキストラス操作ポリシーの転送を課題とする。
  • マーカーなしのトラッキングや専用センサを用いずに、安価で市販のロボットハンド上で高性能な視覚ベースのインハンド操作を可能にする。
  • 大規模なCPUクラスターや高価なハードウェアを必要としていた先行のシミュレーションから現実へのアプローチと比較して、計算コストと複雑さを低減する。
  • ドメインランダマイゼーションとカリキュラム学習を用いて、多様な物理的条件やオブジェクトの姿勢に一般化できる、強固なエンドツーエンドのシステムを開発する。
  • コードとトレーニングパイプラインを公開することで、再現可能性を実現し、先端的なデキストラス操作をより広範な研究コミュニティが利用可能にする。

提案手法

  • GPUアクセceleratedなIsaac Gymシミュレーション環境で、ドメインランダマイゼーションを適用した視覚ベースのポリシーを、深層強化学習(PPO)を用いてトレーニングする。
  • 自動ドメインランダマイゼーション(ADR)を適用し、物理的パrameter(摩擦、減衰、剛性)と非物理的要因(テクスチャ、照明、カメラノイズ)をランダム化することで、シミュレーションから現実への一般化を向上させる。
  • 3台の市販カメラからのRGB画像を用いて、完全に微分可能な、シミュレーションでトレーニングされた6次元オブジェクト姿勢推定器を開発し、マーカーなしでリアルタイムの状態推定を可能にする。
  • 段階的なランダマイゼーションを用いたカリキュラムベースのトレーニング戦略を採用し、学習の安定性を高め、現実世界の変動に対する耐性を向上させる。
  • 最適化された推論とカメラ-ロボットキャリブレーションを用いて、実際のロボット上でポリシーと姿勢推定器をリアルタイムで実行するパイプラインを実装する。
  • 現実世界の状態を再レンダリングしてシミュレーションに戻すことで、リアルからシミュレーションへのデータ拡張を実現し、姿勢推定器を最適化し、シミュレーションから現実へのギャップを埋める。
Figure 1 : The hardware setup used in this work, unlike [ 1 ] , is not housed in a cage, and our system is robust enough to perform the task in an open laboratory environment. The background in the image is alpha-blended for visibility.
Figure 1 : The hardware setup used in this work, unlike [ 1 ] , is not housed in a cage, and our system is robust enough to perform the task in an open laboratory environment. The background in the image is alpha-blended for visibility.

実験結果

リサーチクエスチョン

  • RQ1特権付き状態情報なしで、シミュレーションでトレーニングされた視覚ベースのポリシーが、低価格のロボットハンドで高精度なインハンド操作を達成できるか?
  • RQ2特権なしで視覚ベースの設定における自動ドメインランダマイゼーション(ADR)が、デキストラス操作のシミュレーションから現実へのギャップをどれほど効果的に埋められるか?
  • RQ3完全に微分可能な、シミュレーションでトレーニングされた姿勢推定器が、重度のオクルージョンや現実世界の視覚的変化をどれほど効果的に処理できるか?
  • RQ48枚のA40 GPUと市販ハードウェアのみを用いたシステムが、400台のCPUサーバーと高価なモーションキャプチャシステムを必要としていた先行手法を上回れるか?
  • RQ5ドメインランダマイゼーション、カリキュラム学習、リアルからシミュレーションへのデータ拡張の組み合わせが、ポリシーの一般化性能と現実世界での成功確率をどれほど向上させるか?

主な発見

  • 視覚ベースのポリシーは、オブジェクトの再方向転置タスクにおいて、文脈上最高の視覚ベース手法を上回る92%の現実世界での成功確率を達成した。
  • マーカー付きのモーションキャプチャ手法と同等の性能を示したため、特権付き状態情報なしの視覚オンリーシステムでも同等の結果を達成可能であることを実証した。
  • 重度のオクルージョンや多様な照明条件下でも高い精度を維持し、多様な現実世界の条件下で強固に一般化した。
  • トレーニングにはたった8枚のNVIDIA A40 GPUのみを必要とし、OpenAIの400サーバーCPUクラスターや32枚のV100と比較して、計算コストが10倍も低減され、参入障壁が著しく低下した。
  • ADRと段階的ランダマイゼーションの適用により、安定したトレーニングプロセスが実現され、シミュレーションから現実への転送性能が向上し、最良のポリシーでは現実世界テストで92%の成功確率を達成した。
  • 故障した親指などのハードウェア的欠陥に対しても耐性を示し、多様なオブジェクトの姿勢や初期姿勢に対しても一般化性能を示した。
(a) Policy training.
(a) Policy training.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。