Skip to main content
QUICK REVIEW

[論文レビュー] Learning Multiple Gaits within Latent Space for Quadruped Robots

Jinze Wu, Yufei Xue|arXiv (Cornell University)|Aug 6, 2023
Robotic Locomotion and ControlEngineering被引用数 3
ひとこと要約

本論文は、歩行エンコーダーとジェネレータによって同時に学習される潜在空間を用いて、四足歩行ロボットの複数の歩行様式を学習するエンドツーエンド強化学習フレームワークを提案する。これにより、適応的で滑らかな歩行遷移とユーザー制御可能な歩行行動が可能となる。本手法は、プロ prioceptiveフィードバックのみを用いて階段の上り下りで100%の成功を達成し、不整地の草生えた地形での俊敏なスプリントでも80%の成功を記録し、先行手法に比べて耐障害性と適応性に優れる。

ABSTRACT

Learning multiple gaits is non-trivial for legged robots, especially when encountering different terrains and velocity commands. In this work, we present an end-to-end training framework for learning multiple gaits for quadruped robots, tailored to the needs of robust locomotion, agile locomotion, and user's commands. A latent space is constructed concurrently by a gait encoder and a gait generator, which helps the agent to reuse multiple gait skills to achieve adaptive gait behaviors. To learn natural behaviors for multiple gaits, we design gait-dependent rewards that are constructed explicitly from gait parameters and implicitly from conditional adversarial motion priors (CAMP). We demonstrate such multiple gaits control on a quadruped robot Go1 with only proprioceptive sensors.

研究の動機と目的

  • ユーザーの指示に応じて、歩行(walk)、トロット(trot)、ペース(pace)、プロンク(pronk)、バウンディング(bound)など複数の歩行様式を学習し、切り替えられるようにすること。
  • 視覚に依存せずに、階段や不整地の草地など複雑な地形でも歩行の耐障害性と俊敏性を向上させること。
  • 多様で自然な歩行様式を学習しつつ、リアルタイム制御と滑らかな遷移を維持する課題に対処すること。
  • 報酬設計が不十分であるか、低レベルポリシーが固定されているために、先行する強化学習手法が不恰好な動きを生成したり、地形間で一般化できなかったりする問題を克服すること。
  • 歩行依存報酬と条件付き対抗的運動事前分布(CAMP)を統合した包括的フレームワークを構築すること。

提案手法

  • 複数の歩行様式の行動をエンドツーエンドで学習するため、非対称アクター・クリティック強化学習フレームワークを用いる。
  • 歩行エンコーダーと歩行ジェネレータによって同時に学習される潜在空間Zを用い、異なる歩行スキル間の滑らかな補間と選択を可能にする。
  • 明示的な歩行パラメータと暗黙の条件付き対抗的運動事前分布(CAMP)を用いて、自然な運動生成を導く歩行依存報酬を設計する。
  • CAMP部では、条件付きディスクラミネーターを用いて、生成された運動が多様なエキスパート歩行データセットのスタイルと力学的特性と一致することを保証する。
  • 外部センサーを一切使用せず、プロ prioceptive観測のみで訓練されるため、実機ハードウェアでもリアルタイム制御が可能である。
  • スキル表現(潜在空間)とタスク固有のポリシー適応を分離することで、複数歩行学習におけるタスクの衝突を回避する。

実験結果

リサーチクエスチョン

  • RQ11つのエンドツーエンド強化学習ポリシーが、自然で滑らかな運動とリアルタイム性能を維持しながら、複数の歩行様式を学習し切り替えられるか?
  • RQ2同時に学習される潜在空間は、四足歩行の歩行遷移の滑らかさとスキル再利用性をどのように向上させるか?
  • RQ3視覚を用いずに、歩行依存報酬とCAMPを用いて訓練されたポリシーは、階段や草地のような複雑な地形にどの程度一般化可能か?
  • RQ4ハイアーチカルまたはティーチャーステューデントフレームワークと比較して、本手法は困難な地形における耐障害性と俊敏性で優れているか?
  • RQ5ユーザーが歩行タイプと速度を制御できる状態で、プロ prioceptiveフィードバックのみで高い性能を達成できるか?

主な発見

  • 提案手法は、高さ20 cm、幅25 cmの段差を上り下りする際、100%の成功率を達成し、ベースライン手法を上回った。
  • 2.5 m/sの速度で草生えた不整地を俊敏に走破する際、80%の成功率を記録した。これは、MoBベースライン(20%)と従来ベースライン(60%)を大きく上回った。
  • 適応的歩行(C)は、ハイアーチカル手法(H)と比較して、高さのある段差や急斜面でも優れた耐障害性を示し、低レベルポリシーの一般化能力の優位性を示した。
  • 連続的な潜在空間のおかげで、異なる歩行スキル間の滑らかな遷移が達成され、不恰好な動きが発生しなかった。
  • 教師-生徒フレームワークを用いたベースラインでさえも、非対称アクター・クリティック構造のおかげでシミュレーションから実機へのギャップが小さく、本手法は両方のタスクで優れた性能を示した。
  • 本システムは、ユーザーの指示に従い、自然な運動スタイルを保ちながら、歩行、トロット、ペース、プロンク、バウンディング、適応的歩行の合計6種類の明確に区別できる歩行様式を学習・実行した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。