[論文レビュー] Gait Library Synthesis for Quadruped Robots via Augmented Random Search
本論文では、各半歩の端部軌道を学習することで、前向きトロット、後退トロット、サイドステップ、旋回を含む四足歩行の歩行パターンのライブラリを合成する強化学習ベースの手法を提案する。本手法は、立方スプライン補間を用いた線形ポリシーを採用し、実験データから導出された線形状態変換を用いることで、低コストのハードウェア上で安定かつ耐障害性のある歩行を実現し、計算コストを最小限に抑える。
In this paper, with a view toward fast deployment of learned locomotion gaits in low-cost hardware, we generate a library of walking trajectories, namely, forward trot, backward trot, side-step, and turn in our custom-built quadruped robot, Stoch 2, using reinforcement learning. There are existing approaches that determine optimal policies for each time step, whereas we determine an optimal policy, in the form of end-foot trajectories, for each half walking step i.e., swing phase and stance phase. The way-points for the foot trajectories are obtained from a linear policy, i.e., a linear function of the states of the robot, and cubic splines are used to interpolate between these points. Augmented Random Search, a model-free and gradient-free learning algorithm is used to learn the policy in simulation. This learned policy is then deployed on hardware, yielding a trajectory in every half walking step. Different locomotion patterns are learned in simulation by enforcing a preconfigured phase shift between the trajectories of different legs. The transition from one gait to another is achieved by using a low-pass filter for the phase, and the sim-to-real transfer is improved by a linear transformation of the states obtained through regression.
研究の動機と目的
- 低コストの埋め込みプラットフォームに適した、高速で低複雑性の四足歩行パターン生成手法の開発。
- 実験データから導出された線形状態変換を用いることで、強化学習におけるシミュレーションから実世界へのギャップを解消する。
- 深層ニューラルネットワークを避けることで、フィードバックを考慮した線形ポリシーにより、リアルタイムでの耐障害性を実現する。
- 自作四足ロボットStoch 2上で、前向き/後退トロット、サイドステップ、旋回の複数の歩行パターンを実証する。
- 最小限のハイパーパrameterチューニングと低計算コストで、効率的なシミュレーションから実世界への移行を実現する。
提案手法
- 線形ポリシーがロボットの状態を制御点にマッピングし、立方スプライン補間を用いてウェイポイント間を補間する。
- シミュレーション内でポリシーを最適化するために、モデルフリーで勾配フリーな強化学習アルゴリズムである拡張ランダムサーチ(ARS)を用いる。
- 脚の軌道間の位相シフトを事前に設定することで、異なる歩行パターン(例:トロット、旋回、サイドステップ)を生成する。
- 歩行位相にローパassフィルタを適用し、歩行パターン間の滑らかな遷移を可能にする。
- 実験的なモーターアングルとシミュレーテッド状態の間で重み付き線形回帰を実行し、シミュレーションと実世界の乖離を補正する変換行列M̂を導出する。
- 変換されたポリシーŷ(𝑠) = M̂𝑀𝑠 + M̂𝑏 を用いて、実世界の追従性能に一致する制御点を生成する。
実験結果
リサーチクエスチョン
- RQ1ARSを用いて学習した線形ポリシーは、シミュレーションで多様で安定した四足歩行パターンを生成し、実ハードウェアへ効果的に転送できるか?
- RQ2深層ニューラルネットワークを用いずに、線形状態変換が四足歩行のシミュレーションから実世界へのギャップをどれほど効果的に埋められるか?
- RQ3提案手法は、最小限の計算コストで外部の摂動に対して耐障害性を持ち、自己補正動作を示せるか?
- RQ4実世界のハードウェア上での制御性能は、軌道追従精度と歩行の安定性の観点でどの程度の水準にあるか?
- RQ5前向き/後退トロット、サイドステップ、旋回といった異なる歩行パターンは、実世界の条件下でどれほど一般化され、滑らかに遷移できるか?
主な発見
- 線形変換を適用した後、シミュレーテッドと実験的なモーターアングル間のネット状態誤差はわずか0.01 radにまで低下した。
- ロボットは、実機上での前向きトロット、後退トロット、サイドステップ、旋回の4つの歩行パターンを安定的かつ繰り返し可能な性能で実行した。
- 外部の摂動に対して関節角度が自己補正する挙動を示し、線形ポリシーによる耐障害性が裏付けられた。
- 50ステップ以上の歩行で安定したリミットサイクル行動を示し、長期的な歩行の一貫性が確認された。
- 軌道追従性能は高く、図7に示すように、すべての歩行パターンにおいて実際のエンドフォート軌道が望ましいものに近く一致した。
- ARSによる学習時間は、同じハードウェア上で実行された深層強化学習手法と同等であったが、デプロイされたポリシーは極めて少ない計算リソースで動作した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。