Skip to main content
QUICK REVIEW

[論文レビュー] Learning multiple gaits of quadruped robot using hierarchical reinforcement learning

Yun-Ho Kim, Bukun Son|arXiv (Cornell University)|Dec 9, 2021
Robotic Locomotion and Control被引用数 4
ひとこと要約

本論文では、速度指令に応じて複数の歩行様式(トロット、ペース、バウンド)を学習する階層的強化学習制御器を提案する。2段階のポリシー構造を採用:上位層で歩行様式選択と周期調整を行う中枢パターン生成器(CPG)と、下位層で関節追従を実現する局所フィードバック制御。この手法により、速度範囲全体でエネルギー効率の良い移動が実現され、速度にかかわらず1つの歩行様式に固定される単一ポリシー手法を上回る性能を発揮する。

ABSTRACT

There is a growing interest in learning a velocity command tracking controller of quadruped robot using reinforcement learning due to its robustness and scalability. However, a single policy, trained end-to-end, usually shows a single gait regardless of the command velocity. This could be a suboptimal solution considering the existence of optimal gait according to the velocity for quadruped animals. In this work, we propose a hierarchical controller for quadruped robot that could generate multiple gaits (i.e. pace, trot, bound) while tracking velocity command. Our controller is composed of two policies, each working as a central pattern generator and local feedback controller, and trained with hierarchical reinforcement learning. Experiment results show 1) the existence of optimal gait for specific velocity range 2) the efficiency of our hierarchical controller compared to a controller composed of a single policy, which usually shows a single gait. Codes are publicly available.

研究の動機と目的

  • 単一ポリシー強化学習の限界、すなわち速度指令に関係なく常に1つの歩行様式しか学習しないという点を是正すること。
  • 四足歩行ロボットが所望の速度に応じて、自ら複数の歩行様式(トロット、ペース、バウンド)を切り替えられることを実現すること。
  • CPGに基づく歩行様式計画と局所フィードバックを組み合わせた階層的制御により、エネルギー効率の向上と速度追従性能の改善を図ること。
  • 生物学的四足動物の観察から、最適な歩行様式は速度に依存することを示すこと。
  • 参照運動データやヒューリスティックな報酬形状に依存せず、スケーラブルで頑健な複数歩行様式移動のフレームワークを提供すること。

提案手法

  • 制御器は2段階の階層的構造を採用:上位層で歩行様式選択と周期調整を行うCPGポリシー、下位層で関節トルク制御を行うフィードバックポリシー。
  • 上位層ポリシーはCPGの位相と周期信号を出力し、これにより4本の脚にわたる周期的な歩行パターンが生成される。
  • 下位層ポリシーはCPG信号とリアルタイムの足接触/環境フィードバックを用いて、PD制御と局所フィードバックにより関節トルクを計算する。
  • 学習の一般化を向上させるために、カリキュラム学習戦略を適用し、訓練中に徐々に速度指令範囲を拡大する。
  • 報酬関数は複数のコスト項を組み合わせており、速度追従誤差(回転および直線方向)、トルク効率、関節速度、足のクリアランス、スリップ、姿勢、滑らかさ、脚の位相一貫性を含む。
  • CPG信号は位相シフトと周期調整を可能にし、歩行様式間の遷移を可能にするが、遷移中に急激な位相変化が生じると追従性能が低下する。

実験結果

リサーチクエスチョン

  • RQ1強化学習制御器は、変化する速度指令に応じて、明確に区別できる複数の歩行様式(トロット、ペース、バウンド)を学習できるか?
  • RQ2CPGに基づく上位層ポリシーを有する階層的制御は、エンドツーエンドの単一ポリシー手法に比べ、より高いエネルギー効率と歩行様式の適応性を実現できるか?
  • RQ3速度追従誤差とエネルギー消費の観点から、複数歩行様式制御器の性能は単一歩行様式ベースラインと比べてどうなるか?
  • RQ4CPGの位相と周期は、滑らかな歩行様式遷移と適応的移動を実現するために果たす役割は何か?
  • RQ5制御器は、生物学的四足動物の行動を模倣して、速度に応じた最適な歩行様式選択を学習できるか?

主な発見

  • 提案された階層的制御器は、異なる速度範囲にわたり、トロット、ペース、バウンドの複数の歩行様式を正常に学習・実行し、適応的歩行様式選択を実証した。
  • 単一ポリシーベースラインと比較して、特定の速度範囲で低いエネルギー消費を達成しており、効率性の向上を示した。
  • 単一ポリシーベースラインは、指令速度に関係なく常に1つの歩行様式(トロット)に収束し、不自然で非最適な移動を示した。
  • 速度追従誤差は、歩行様式変更時のCPG位相の急激な遷移のため、複数歩行様式制御器で高くなった。これは、より滑らかな位相管理の必要性を示唆している。
  • CPGベースの制御器は、接触干渉に対して頑健であり、接触およびCPG信号のプロットから、複数の歩行様式間でも安定した移動を維持していた。
  • 足のクリアランス、スリップ、滑らかさの項を含む報酬関数の設計により、安定で安全な移動が実現し、足のスリップを最小限に抑え、最適なクリアランスを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。