[論文レビュー] Learning Generalizable Locomotion Skills with Hierarchical Reinforcement Learning
本論文は、モデルフリーなサイクル運動プリミティブの学習と粗い動的モデルを用いたモデルベースの計画を組み合わせることで、サンプル効率的で一般化可能なゴール指向の歩行を実世界のロボットに実現する階層的強化学習フレームワークを提案する。この手法により、18自由度のヘキサポッドロボットは、ハードウェアでわずか2時間の訓練のみで、最大12メートル離れたゴールに到達する能力を習得した。ノイズや環境の変化に対しても頑健であることが実証された。
Learning to locomote to arbitrary goals on hardware remains a challenging problem for reinforcement learning. In this paper, we present a hierarchical learning framework that improves sample-efficiency and generalizability of locomotion skills on real-world robots. Our approach divides the problem of goal-oriented locomotion into two sub-problems: learning diverse primitives skills, and using model-based planning to sequence these skills. We parametrize our primitives as cyclic movements, improving sample-efficiency of learning on a 18 degrees of freedom robot. Then, we learn coarse dynamics models over primitive cycles and use them in a model predictive control framework. This allows us to learn to walk to arbitrary goals up to 12m away, after about two hours of training from scratch on hardware. Our results on a Daisy hexapod hardware and simulation demonstrate the efficacy of our approach at reaching distant targets, in different environments and with sensory noise.
研究の動機と目的
- 実世界の脚部ロボットの強化学習におけるサンプル非効率性と一般化性能の低さという課題に対処すること。
- シミュレーションから実機への転送に依存せず、ハードウェア上で直接学習し、データ効率を向上させることで、任意の未観測のターゲットに一般化可能なゴール指向の歩行ポリシーを学習可能とすること。
- シミュレーションから実機への転送に依存せず、ハードウェア上で直接学習し、データ効率を向上させることで、任意の未観測のターゲットに一般化可能なゴール指向の歩行ポリシーを学習可能とすること。
- 低レベルのスキル学習と高レベルのゴール計画を分離することでスケーラブルなフレームワークを構築すること。
- 実世界での運用において、センサのノイズや環境の変化に対して高い頑健性を発揮すること。
提案手法
- サンプル効率を向上させるために、低レベルの歩行ポリシーを周期的運動(例:前進歩行、旋回)としてパラメータ化する。
- モデルフリーな強化学習(Soft Actor-Critic)を用いて、これらの周期的ポリシーをハードウェア上で直接訓練する。
- 各プリミティブの1サイクル分の行動に対して、1つのプリミティブあたり50サンプルのハードウェアデータのみを用いて粗い動的モデルを学習する。
- 粗い動的モデルを用いたモデル予測制御(MPC)により、任意のゴールに到達するためのプリミティブのシーケンスを計画する。
- 高レベルコントローラーに方向誘導報酬を導入し、グローバル位置センシングのドリフトを補正する。
- 制御問題を2段階に分解する:まず多様なプリミティブを学習し、次に学習済みの動的モデルを用いてそれらのシーケンスを計画する。

実験結果
リサーチクエスチョン
- RQ1階層的RLフレームワークは、実世界の歩行学習におけるサンプル効率性と一般化性能を向上させることができるか?
- RQ2歩行ポリシーの周期的パラメータ化は、高自由度のハードウェアロボットにおける学習効率を向上させることができるか?
- RQ3最小限のハードウェアデータで学習された粗い動的モデルは、任意のゴールに対する長時間スパンの計画を効果的に行うことができるか?
- RQ4本フレームワークは、遠距離のターゲット、異なる地形、センサのノイズといった実世界の状況において、どれほど一般化性能を発揮するか?
- RQ5モデルフリーとモデルベースのコンponentの組み合わせは、純粋にモデルフリーまたはモデルベースのアプローチを上回る性能を実世界の歩行で達成できるか?
主な発見
- Daisyヘキサポッドロボットは、ハードウェア上で直接2時間の訓練を経て、出発位置から最大12メートル離れたゴールに到達する能力を習得した。
- 再トレーニングなしに、さまざまな床面やセンサのノイズを含む異なる環境に対しても、頑健に一般化した。
- 方向誘導報酬を備えた高レベルコントローラーにより、位置推定のずれを補正でき、トレーキングエラーがあっても正確なゴール到達が可能となった。
- ハードウェア実験において、単一ゴールタスクおよび順次ウェイポイントタスクの両方で、信頼性の高い性能を発揮した。
- 1プリミティブあたり50サンプルのデータでの学習により、粗い動的モデルを用いたプリミティブ空間における効率的で効果的な計画が可能となった。
- 本手法は、実世界の脚部ロボットにおけるゴール指向歩行の分野で、初めての成功したハイブリッドなモデルフリーとモデルベースの強化学習フレームワークを実現した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。