[論文レビュー] Feedback Control For Cassie With Deep Reinforcement Learning
本稿では、現実的なMuJoCoシミュレーションを用いて、Cassie二足歩行ロボットの頑健でモデルフリーなフィードバック制御系を学習するための深層強化学習(DRL)フレームワークを提案する。模倣学習をマークフ・決定過程(MDP)として定式化することで、速度の異なる状況下でも参照運動を追従する制御系を学習し、感覚遅延、不整地帯、大きな外部力への耐性を示す。補間されたポリシーにより、歩行速度の適応的制御が可能である。
Bipedal locomotion skills are challenging to develop. Control strategies often use local linearization of the dynamics in conjunction with reduced-order abstractions to yield tractable solutions. In these model-based control strategies, the controller is often not fully aware of many details, including torque limits, joint limits, and other non-linearities that are necessarily excluded from the control computations for simplicity. Deep reinforcement learning (DRL) offers a promising model-free approach for controlling bipedal locomotion which can more fully exploit the dynamics. However, current results in the machine learning literature are often based on ad-hoc simulation models that are not based on corresponding hardware. Thus it remains unclear how well DRL will succeed on realizable bipedal robots. In this paper, we demonstrate the effectiveness of DRL using a realistic model of Cassie, a bipedal robot. By formulating a feedback control problem as finding the optimal policy for a Markov Decision Process, we are able to learn robust walking controllers that imitate a reference motion with DRL. Controllers for different walking speeds are learned by imitating simple time-scaled versions of the original reference motion. Controller robustness is demonstrated through several challenging tests, including sensory delay, walking blindly on irregular terrain and unexpected pushes at the pelvis. We also show we can interpolate between individual policies and that robustness can be improved with an interpolated policy.
研究の動機と目的
- 現実世界のロボットのダイナミクスを最大限に活用するモデルフリーな深層強化学習に基づくフィードバック制御フレームワークを、二足歩行ロボティクスに開発すること。
- モデルベース制御の限界を克服し、Cassieロボットのリアルなシミュレーション上でDRLが頑健で高性能な歩行制御系を生成できることを示すこと。
- 物理的に不成立な状況であっても、参照運動の再タイムスケーリングにより、異なる歩行速度用の制御系を学習可能にすること。
- 異なる速度用に訓練されたポリシー間の補間により、制御系の頑健性を向上させること。
- 感覚遅延、不規則な地形での視界のない歩行、外部の力の作用といった厳しい条件下でのアプローチの有効性を検証すること。
提案手法
- フィードバック制御問題を、参照運動を模倣することを目的としたマークフ・決定過程(MDP)として定式化する。
- ポリシーのパrameter化に多層ニューラルネットワークを用い、状態と参照軌道入力から制御入力をエンドツーエンドで学習可能にする。
- 追従誤差と安定性指標に基づくスパarsely denseな報酬を用いて、ポリシー勾配強化学習によりポリシーを訓練する。
- 物理的に不成立な運動(例:足の滑りを伴う)が生じる場合でも、元の参照軌道を時間スケーリングすることで、異なる速度用の参照運動を生成する。
- 2つのポリシーの出力をパrameter λ に基づいてブレンドすることでポリシー補間を実装し、異なる速度の歩行パターン間での滑らかな遷移を可能にする。
- ロボットの現在の速度に応じてλを動的に変化させる適応的補間を実装し、坂道での自然な加速・減速を実現する。
実験結果
リサーチクエスチョン
- RQ1深層強化学習は、簡略化されたダイナミクスモデルに依存せずに、Cassieのような現実的な二足歩行ロボットに対して、頑健でモデルフリーなフィードバック制御系を学習できるか?
- RQ2DRLは、足の滑りを伴う時間スケーリングされた歩行など、物理的に不成立な参照運動を追従する制御系をどれほど効果的に学習できるか?
- RQ3異なる速度用の制御系間の補間ポリシーは、非均一な地形において単一速度ポリシーに比べて、より高い頑健性を示せるか?
- RQ4DRLベースの制御系は、感覚遅延、視界のない歩行、大きな外部撃力といった現実世界の課題に対して、どの程度耐性を示せるか?
- RQ5本フレームワークは、ランニングやジャンプといった新しい参照運動へ、ゼロショット適応を可能にするように拡張可能か?
主な発見
- DRLベースの制御系は、足の滑りを伴う物理的に不成立な運動であっても、参照運動の時間スケーリング版を学習することで、さまざまな速度での歩行を成功裏に学習した。
- 感覚遅延が最大100 msまで存在しても、安定した歩行を維持し、顕著な性能低下を示さなかった。
- 不整地帯では、高さ0.22 mの正弦波状の地形に対しても、補間ポリシーが非補間ポリシーを著しく上回る安定性を示した。
- 前方50 N、後方70 N、横方向15 Nの外部力に対しても、強い外乱抑制性能を示した。
- 補間ポリシーにより、坂道での自然な加速・減速が可能となり、追加のトレーニングなしに適応的歩行制御を実現した。
- 新しい参照運動を用いることで、本フレームワークは新たな行動に拡張可能であり、多様な歩行タスクに対するゼロショット学習の可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。