[論文レビュー] Dynamics and Domain Randomized Gait Modulation with Bezier Curves for Sim-to-Real Legged Locomotion
本論文では、ダイナミクスとドメインランダマイゼーションを用いて、四足歩行ロボットのベジエ曲線ベースの歩行パターンを調整するポリシーを学習する、シミュレーションから実世界への強化学習フレームワークD2-GMBCを提案する。ポリシーはシミュレーションでのインertial測定値のみを用いて訓練され、接触センシングや実世界での微調整を一切必要とせず、未知の粗い地形を効果的に走破可能である。非ランダマイズド訓練に比べ5.6倍高い生存距離を達成し、実機でも4.28倍の性能向上を達成した。
We present a sim-to-real framework that uses dynamics and domain randomized offline reinforcement learning to enhance open-loop gaits for legged robots, allowing them to traverse uneven terrain without sensing foot impacts. Our approach, D$^2$-Randomized Gait Modulation with Bezier Curves (D$^2$-GMBC), uses augmented random search with randomized dynamics and terrain to train, in simulation, a policy that modifies the parameters and output of an open-loop Bezier curve gait generator for quadrupedal robots. The policy, using only inertial measurements, enables the robot to traverse unknown rough terrain, even when the robot's physical parameters do not match the open-loop model. We compare the resulting policy to hand-tuned Bezier Curve gaits and to policies trained without randomization, both in simulation and on a real quadrupedal robot. With D$^2$-GMBC, across a variety of experiments on unobserved and unknown uneven terrain, the robot walks significantly farther than with either hand-tuned gaits or gaits learned without domain randomization. Additionally, using D$^2$-GMBC, the robot can walk laterally and rotate while on the rough terrain, even though it was trained only for forward walking.
研究の動機と目的
- 接触センシングを用いずに、モデル化されていない粗い地形を歩行ロボットが走破できるようにすること。
- ダイナミクスと地形のランダマイズドなシミュレーションを用いて、シミュレーションと実世界のギャップを埋めるポリシーの訓練により、歩行ロボットのシミュレーションから実世界への移行を改善すること。
- 強化学習を用いてオープンループのベジエ曲線歩行パターンを改善し、より高い耐障害性と適応性を実現すること。
- 前方歩行の訓練のみで行う1つのポリシーを用いて、前進、横方向、回転移動を含む全方向走行を可能にすること。
- 最小限の実世界データに依存し、ドメインランダマイゼーションを用いたシミュレーションのみで高い性能を達成すること。
提案手法
- 12の制御点を用いたベジエ曲線歩行生成器により、足の軌道を定義し、τおよびψでパrameter化する。
- 増強ランダムサーチ(ARS)を用いて訓練された強化学習ポリシーが、インertial測定値のみを用いて、リアルタイムに歩行パラメータ(τ, ψ)を調整する。
- シミュレーションから実世界への一般化を向上させるために、ダイナミクス(例:慣性、摩擦)および地形特性(例:表面粗さ、勾配)のドメインランダマイゼーションを採用する。
- 外部の操舵指令を用いてポリシーを訓練することで、追加の訓練なしに横方向および回転移動を可能にする。
- フェーズロックドクロック機構を用いて、前方左脚の衝突時刻に基づき脚の軌道を同期化し、フェーズラグを設定することでトロット歩行を実現する。
- 接触センシングを完全に回避し、リアルタイムでインエラーシャンジングフィードバックのみに依存して歩行パラメータを調整する。
実験結果
リサーチクエスチョン
- RQ1ドメインランダマイゼーションを用いたシミュレーションで訓練されたポリシーは、接触センシングを一切行わずに、実世界の粗い地形に一般化可能か?
- RQ2ダイナミクスと地形の両方をランダマイズすることで、ダイナミクスのみをランダマイズする場合に比べ、シミュレーションから実世界への転送性能が向上するか?
- RQ3前方歩行の訓練のみで学習されたポリシーは、追加の訓練なしに横方向歩行や回転移動を実現できるか?
- RQ4D2-GMBCは、シミュレーションおよび実世界テストの両方において、手動チューニングされた歩行パターンや非ランダマイズド学習ベースラインと比較して、性能に優れているか?
- RQ5本手法は、不整地帯での耐障害性を確保しつつ、平坦な地面での前進速度をどの程度維持できるか?
主な発見
- D2-GMBCは、非ランダマイズド訓練ベースラインと比較して、シミュレーションにおけるランダム化された粗い地形で5.6倍高い生存距離(90m以上)を達成したが、訓練中は性能が劣っていたにもかかわらず、その結果を示した。
- 実機においては、D2-GMBCは手動チューニングされたベジエ歩行パターンに比べ、松の玉砂利など、シミュレーションメッシュとは顕著に異なる地形でも4.28倍の走行距離を達成した。
- ポリシーは、前方歩行の訓練のみで実施されたにもかかわらず、粗い地形での横方向歩行および回転移動を成功させ、新たな運動指令への一般化を示した。
- 平坦な地面では全方向走行速度を維持しており、標準的な表面でも性能の低下がないことが示された。
- 600エポック未満の訓練で、シミュレーションにおけるデータ効率性を実現した。
- 本フレームワークは、実世界での微調整を一切行わず、インエラーシャンジングフィードバックと地形・接触センシングなしに、直接シミュレーションから実世界へのデプロイを可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。