Skip to main content
QUICK REVIEW

[論文レビュー] Robust and Versatile Bipedal Jumping Control through Reinforcement Learning

Zhongyu Li, Xue Bin Peng|arXiv (Cornell University)|Feb 19, 2023
Robotic Locomotion and Control被引用数 4
ひとこと要約

本論文では、トルク制御が可能な二足歩行ロボットCassieが現実世界で頑健かつ多様なダイナミックジャンプを実行できる強化学習フレームワークを提示する。新しい長期および短期の入出力履歴エンコーダーを備えたゴール条件付きポリシーとマルチステージトレーニングスキームを用いることで、異なる距離、方向、高さのプラットフォームなど多様なターゲットへジャンプする能力を獲得し、高い成功確率と摂動からの自己回復行動を実現した。

ABSTRACT

This work aims to push the limits of agility for bipedal robots by enabling a torque-controlled bipedal robot to perform robust and versatile dynamic jumps in the real world. We present a reinforcement learning framework for training a robot to accomplish a large variety of jumping tasks, such as jumping to different locations and directions. To improve performance on these challenging tasks, we develop a new policy structure that encodes the robot's long-term input/output (I/O) history while also providing direct access to a short-term I/O history. In order to train a versatile jumping policy, we utilize a multi-stage training scheme that includes different training stages for different objectives. After multi-stage training, the policy can be directly transferred to a real bipedal Cassie robot. Training on different tasks and exploring more diverse scenarios lead to highly robust policies that can exploit the diverse set of learned maneuvers to recover from perturbations or poor landings during real-world deployment. Such robustness in the proposed policy enables Cassie to succeed in completing a variety of challenging jump tasks in the real world, such as standing long jumps, jumping onto elevated platforms, and multi-axes jumps.

研究の動機と目的

  • 大型のトルク制御型二足歩行ロボットが、従来のモデルベース手法や単一タスク強化学習手法に見られる制限を克服し、現実世界で機敏でダイナミックなジャンプを実行できるようにすること。
  • ジャンプの離陸、フライト、高衝撃着地を含む、数秒以内に発生する複雑なハイブリッドダイナミクスを制御する課題に対処すること。
  • 前後、横方向、回転、高さ付きジャンプなど多様なジャンプタスクに一般化可能なゴール条件付きポリシーを構築し、頑健性と適応性を向上させること。
  • 動的パラメータのランダム化に依存せず、多様なジャンプタスクのトレーニングによってシミュレーションから実世界への転送性と頑健性を向上させること。
  • トレーニングにおける多様性が、不良着地後にホップに切り替えるなど、事前にプログラムされていない自己回復行動の出現を促進することを実証すること。

提案手法

  • 長期的入出力履歴エンコーダー(過去の軌道を捉える)と短期的エンコーダー(即時のフィードバックを処理する)を統合した二重エンコーダー構造を持つ新しいポリシー・アーキテクチャを提案し、ポリシーと共同で学習させる。
  • 複雑なマルチゴールジャンプ問題を3つの部分問題に分解するマルチステージトレーニングスキームを実装:(1) 基本的なジャンプの学習、(2) 多様なジャンプターゲットの学習、(3) 頑健性と一般化性のためのファインチューニング。
  • ゴール条件付き強化学習を用いて、状態とゴール(例:ターゲット位置、姿勢)からトルク指令値へのマッピングを学習する単一ポリシーを訓練し、新しいターゲットへのゼロショットデプロイメントを可能にする。
  • 時間的エンコーダーを統合し、環境パラメータを事前に指定せず、ロボット自身の入出力履歴(例:衝撃力、接触遷移)から関連情報を抽出する能力を学習させる。
  • 高精度なMuJoCoシミュレーションで動的パラメータとゴール分布をランダム化してトレーニングし、実機Cassieロボットに直接デプロイすることでシミュレーションから実世界への転送を実現する。
  • カリキュラム学習とカリキュラムベースのゴールスケジューリングを適用し、トレーニング中に段階的にタスクの多様性と難易度を向上させ、サンプル効率とポリシーの一般化性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1単一のゴール条件付き強化学習ポリシーが、異なる場所、方向、高さへのジャンプを含め、現実世界で多様なダイナミックジャンプを実行できるか。
  • RQ2複数ゴール同時学習が、摂動や不良着地にさらされた状況下でもポリシーの頑健性に与える影響は何か。
  • RQ3ポリシー・アーキテクチャに長期的および短期的入出力履歴を組み込むことで、複雑で高衝撃的なジャンプタスクにおける学習効率とパフォーマンスがどの程度向上するか。
  • RQ4多様なゴールでトレーニングされたポリシーは、ファインチューニングなしにシミュレーションから実世界に一般化可能か。また、タスクの多様性はこのシミュレーションから実世界への転送にどのような役割を果たすか。
  • RQ5複数のジャンプタスクでトレーニングすることで、失敗した着地後にホップに切り替えるなど、事前にプログラムされていない自己回復行動が出現するか。

主な発見

  • 提案手法は、実機Cassieロボットで最大1.4メートルの前方向ジャンプを達成し、先行研究の約0.5メートルに比べ顕著な性能向上を示した。
  • ロボットは、最大1.4メートルの前進ジャンプ、±0.3メートルの横ジャンプ、±55度の回転ジャンプ、0.44メートルの高さのプラットフォームへのジャンプを成功させ、高い多様性を示した。
  • シミュレーションでは多様なジャンプタスクで90%の成功確率を達成し、実世界デプロイでも80%以上の成功確率を維持した。これは、強力なシミュレーションから実世界への転送能力を示している。
  • マルチゴールトレーニングから生じた頑健性により、大きな着地衝撃や外部摂動に対しても、再計画なしに別の学習済み動作(例:ホップ)に切り替える自己回復が可能になった。
  • アブレーションスタディの結果、動的パラメータのランダム化を伴う単一タスク学習と比較して、マルチゴールトレーニングは摂動を加えた状況下でも顕著に頑健性が向上した。
  • 二重エンコーダー構造(長期および短期のI/O履歴)は、別個の教師-生徒トレーニングとファインチューニングを必要とするRMA/TSなどの先行手法を上回り、履歴I/Oデータのより柔軟かつ直接的な利用を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。