Skip to main content
QUICK REVIEW

[論文レビュー] CAJun: Continuous Adaptive Jumping using a Learned Centroidal Controller

Yuxiang Yang, Guanya Shi|arXiv (Cornell University)|Jun 16, 2023
Robotic Locomotion and Control被引用数 6
ひとこと要約

CAJun は、重心ポリシーと QP に基づく低レベルの脚制御を組み合わせることで、歩行ロボットが連続的で適応可能な長距離飛距離ジャンプを実現する階層的強化学習フレームワークである。1枚の GPU で 20 分未満で訓練され、Unitree Go1 ロボットで 70cm のギャップを越える能力を発揮し、シミュレーションから実世界へのドメインギャップが最小限に抑えられ、エンドツーエンドの強化学習手法を上回る実世界での性能を発揮する。

ABSTRACT

We present CAJun, a novel hierarchical learning and control framework that enables legged robots to jump continuously with adaptive jumping distances. CAJun consists of a high-level centroidal policy and a low-level leg controller. In particular, we use reinforcement learning (RL) to train the centroidal policy, which specifies the gait timing, base velocity, and swing foot position for the leg controller. The leg controller optimizes motor commands for the swing and stance legs according to the gait timing to track the swing foot target and base velocity commands using optimal control. Additionally, we reformulate the stance leg optimizer in the leg controller to speed up policy training by an order of magnitude. Our system combines the versatility of learning with the robustness of optimal control. By combining RL with optimal control methods, our system achieves the versatility of learning while enjoys the robustness from control methods, making it easily transferable to real robots. We show that after 20 minutes of training on a single GPU, CAJun can achieve continuous, long jumps with adaptive distances on a Go1 robot with small sim-to-real gaps. Moreover, the robot can jump across gaps with a maximum width of 70cm, which is over 40% wider than existing methods.

研究の動機と目的

  • 障害物の多い地形や大きなギャップを有する環境において、歩行ロボットが連続的で適応可能な長距離ジャンプを実行できるようにすること。
  • 四足歩行ロボットの学習ベースのジャンプポリシーにおけるシミュレーションから実世界へのドメインギャップを低減すること。
  • 強化学習の柔軟性と最適化に基づく制御の頑健性を組み合わせた、訓練に効率的なフレームワークを開発すること。
  • 広範な報酬設計やシミュレーションから実世界への微調整を必要とせずに、高性能なジャンプを実現すること。

提案手法

  • 高レベルの重心ポリシーを強化学習で訓練し、歩行タイミング、ベース速度、およびスイング脚位置の目標値を出力する。
  • 低レベルの脚制御は、500Hz で最適なモータ命令を計算するための二次計画法(QP)を用い、リアルタイムのフィードバックと頑健性を確保する。
  • ステンス脚最適化をクリッピングを含む最小二乗問題に再定式化することで、標準的な QP と比較して訓練時間を 10 倍短縮した。
  • 階層的制御スタックを採用:重心ポリシーが高レベルの運動目標を設定し、脚制御がそれを高精度なトルク追従で実行する。
  • 単一の GPU を用いてシミュレーションで訓練し、実際の Unitree Go1 ロボットにゼロショットでデプロイした。
  • 本手法は複数の歩行パターン(プロンキング、バウンディングなど)をサポートし、ユーザーの命令に応じてジャンプ距離を適応的に変更可能である。
Figure 1: Overview of the hierarchical framework of CAJun.
Figure 1: Overview of the hierarchical framework of CAJun.

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習と最適化に基づくフレームワークは、最小限のシミュレーションから実世界へのギャップで、歩行ロボットが連続的で適応可能な長距離ジャンプを実現できるか?
  • RQ2QP に基づく脚制御をクリッピング付き最小二乗問題に再定式化することで、訓練速度とポリシー性能にどのような影響を与えるか?
  • RQ3学習された重心ポリシーは、異なる歩行パターン(例:プロンキング対バウンディング)に一般化可能であり、高いジャンプ距離と安定性を維持できるか?
  • RQ4動的シフト下でのシミュレーション内転送と実世界でのデプロイにおいて、CAJun はエンドツーエンドの強化学習と比較してどのように性能を発揮するか?
  • RQ5長距離ジャンプを達成するために、どのような設計要素(例:スイング残留項、歩行モード変更)が不可欠か?

主な発見

  • CAJun は最大 70cm のギャップを越える能力を達成し、既存手法と比較して 40% 以上広い。
  • ポリシーは微調整なしに実際の Unitree Go1 ロボットにゼロショットでデプロイされ、継続的なジャンプが実現した。
  • 標準的な QP に基づく訓練と比較して、訓練時間を 10 倍短縮し、1 枚の GPU で 20 分未満でポリシーの訓練が可能になった。
  • 実世界テストでは、バウンディング歩行においてエンドツーエンドの強化学習を 25% 上回り、プロンキング歩行では 185% 上回る総重心移動距離を達成した。
  • アブレーションスタディの結果、スイング残留項と歩行モード変更が長距離ジャンプに不可欠であることが確認された。一方、参照軌道なしに直接スイング脚を制御すると、複雑な歩行パターンでの性能が劣化した。
  • 再定式化された QP ソルバーはポリシー性能を維持しながら、著しく訓練効率を向上させ、クローリングやトロットなど他の歩行パターンへの応用にも拡張可能である。
CAJun: Continuous Adaptive Jumping using a Learned Centroidal Controller

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。