[論文レビュー] Reinforcement Learning for Robust Parameterized Locomotion Control of Bipedal Robots
本論文は、ハイブリッドゼロダイナミクス(HZD)に基づくゲートライブラリを用いて、Cassie二足歩行ロボットの頑健でパラメータ化された歩行ポリシーを訓練するモデルフリー強化学習フレームワークを提案する。ドメインランダマイゼーションおよびダイナミクスの変動を伴うシミュレーション内での訓練により、変則速度、高さ、旋回などの多様で機敏なゲートを学習し、再訓練なしにモーター故障、摂動、環境変化に対しても実世界での頑健性を発揮する。
Developing robust walking controllers for bipedal robots is a challenging endeavor. Traditional model-based locomotion controllers require simplifying assumptions and careful modelling; any small errors can result in unstable control. To address these challenges for bipedal locomotion, we present a model-free reinforcement learning framework for training robust locomotion policies in simulation, which can then be transferred to a real bipedal Cassie robot. To facilitate sim-to-real transfer, domain randomization is used to encourage the policies to learn behaviors that are robust across variations in system dynamics. The learned policies enable Cassie to perform a set of diverse and dynamic behaviors, while also being more robust than traditional controllers and prior learning-based methods that use residual control. We demonstrate this on versatile walking behaviors such as tracking a target walking velocity, walking height, and turning yaw.
研究の動機と目的
- 従来のモデルベースのアプローチをはるかに超える多様で動的な行動を処理できる、頑健で多用途な二足歩行ロボットの制御器を開発すること。
- 事前に存在するリファレンス制御器に依存する残留制御手法の限界を克服し、限定的で慎重なゲートを生み出すこと。
- 実世界の展開において、モデル誤差、環境変化、ハードウェア故障(例:モーター損傷)に対する頑健性を向上させること。
- 多様なHZDベースのゲートを直接模倣するエンドツーエンドのポリシー訓練を可能にし、行動の多様性と安定性を向上させること。
- ドメインランダマイゼーションを用いてシミュレーションで訓練されたポリシーを、実世界のCassieロボットに成功裏にシミュレーションから実世界に移行すること。
提案手法
- ハイブリッドゼロダイナミクス(HZD)から導出されたパラメータ化された運動のゲートライブラリを用い、模倣学習のための多様なリファレンス軌道を提供する。
- モデルフリーの深層強化学習を用いて、残留制御項を一切含まずに、これらの多様なゲートを模倣するポリシーを訓練する。
- 訓練中にドメインランダマイゼーションを適用し、特に関節ダンピング比やその他のダイナミクスパラメータをランダム化することで、頑健性を向上させる。
- MuJoCoを用いたシミュレーション環境でポリシーを訓練し、システムダイナミクスや環境条件の変動に一般化できるようにする。
- 訓練済みポリシーを、さらに調整なしに実世界のCassieロボットに直接適用し、多様な訓練データから得られる頑健性を活用する。
- 所望の歩行速度、高さ、ヨー速度の追従を促進するとともに安定性を維持するよう、報酬形状化スキームを用いる。
実験結果
リサーチクエスチョン
- RQ1HZDベースのゲートライブラリに多様なゲートを用いて訓練されたモデルフリー強化学習ポリシーは、シミュレーションおよび実世界の展開において、頑健でパラメータ化された歩行を達成できるか?
- RQ2ドメインランダマイゼーションを用いた訓練は、モーター故障や摩擦変化などの未モデル化されたダイナミクスに対して、どのように頑健性を向上させるか?
- RQ3残留制御を排除し、代わりにゲートライブラリを用いて模倣学習を行うことで、従来の手法と比較して、より優れたパフォーマンスと広い制御入力範囲が得られるか?
- RQ4再訓練なしに、旋回、変則的な歩行高さ、摂動からの回復といった複雑な行動に一般化できるか?
- RQ5学習済みポリシーは、実世界での頑健性において、モデルベースのHZD制御器と残留制御ベースラインをどの程度上回るか?
主な発見
- 提案されたポリシーは、再訓練なしに、変則的な歩行速度、高さ、ヨー速度を実世界のCassieロボットで追従可能であることを確認した。
- 右脚の2つのモーターが損傷している状態でも、調整なしに即座に安定したゲートを維持した。
- シミュレーションにおいて、非残留および残留ベースラインより摂動耐性に優れ、特に高強度の摂動(β = 0.8, 1.0)下でも顕著に優れた性能を示した。
- ゲート遷移中に安定性が向上し、HZDベースのベースライン制御器と比較して、制御可能な入力範囲と安全領域が拡大された。
- 前方、後方、側方のプッシュ、予期しない荷重の付加、地面の摩擦の変化に対しても、ポリシーは正常に回復した。
- 本手法により、高速歩行、横方向移動、旋回といった、従来のモデルベース制御器では信頼性が保てなかった機敏でダイナミックな行動が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。