Skip to main content
QUICK REVIEW

[論文レビュー] A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning

Laura Smith, Ilya Kostrikov|arXiv (Cornell University)|Aug 16, 2022
Robotic Locomotion and Control被引用数 25
ひとこと要約

本論文は、モデルフリー深層RLを用いた実世界の四足歩行の学習を実証し、新規アルゴリズムを用いずにさまざまな地形で約20分の実時計時間内に歩行を達成しています。慎重なタスク設計と実装の重要性を、新規アルゴリズムの進歩よりも強調しています。

ABSTRACT

Deep reinforcement learning is a promising approach to learning policies in uncontrolled environments that do not require domain knowledge. Unfortunately, due to sample inefficiency, deep RL applications have primarily focused on simulated environments. In this work, we demonstrate that the recent advancements in machine learning algorithms and libraries combined with a carefully tuned robot controller lead to learning quadruped locomotion in only 20 minutes in the real world. We evaluate our approach on several indoor and outdoor terrains which are known to be challenging for classical model-based controllers. We observe the robot to be able to learn walking gait consistently on all of these terrains. Finally, we evaluate our design decisions in a simulated environment.

研究の動機と目的

  • 完全にモデルフリーの深層RLが実世界で20分未満で直接四足歩行を学習できることを実証する。
  • 多様な屋内外地形で歩行の頑健性を示すため、新しいアルゴリズム的要素なしで学習を行う。
  • 歩行のサンプル効率を高める設計上の選択肢とシステム要因を特定する。

提案手法

  • SAC/DroQスタイルのフレームワークに基づく正則化(ドロップアウト、レイヤー正規化)を備えたオフポリシーのactor-critic RLを用い、アップデート対データ比を高く保つ。
  • 12関節の20 HzでのPD位置ターゲットを低レベルのアクション空間として用いる。
  • 状態はルート方位/速度、関節状態、足接触、直前のアクションとして定義し、アクションはPDターゲット。
  • 地上平面へ射影された目標速度区間内での単純な速度ベースの報酬を提供する。
  • JAXを用いた実 robot(A1)での同期的な学習を、Q関数のアンサンブルとターゲットネットワークを用いて実施する。
  • サンプル効率を得ることを目的に、新しいアルゴリズム要素を追求するのではなく、さまざまな正則化/正規化戦略を比較する。

実験結果

リサーチクエスチョン

  • RQ1完全にモデルフリーの深層RLが短時間の実時計時間で実世界の四足歩行を学習できるのか?
  • RQ2設計上の選択(アクション空間、報酬、正則化)が実世界の locomotion RL のサンプル効率と学習安定性にどのような影響を及ぼすのか?
  • RQ3実世界のポリシー学習はシミュレーションから現実への転送を伴わずに、複数の地形・環境で頑健か?
  • RQ4同期的なステップごとの更新とエピソード更新が実世界の学習効率にどう影響するのか?

主な発見

  • 実世界での歩行は、設計を慎重に行うことで20分未満の時間(おおよそ20分の実時計時間)で学習可能である。
  • 屋内/屋外を含む5つの地形での学習により、 novelなアルゴリズム要素なしで効果的な歩行パターンを得られる。
  • レイヤー正規化やドロップアウトなどのさまざまな正則化/正規化戦略はアップデート対データ比を高め、サンプル効率を向上させる。
  • 同期的なステップ更新は現実のGPU搭載ノートPCでのリアルタイム学習には実現可能で有益である。
  • アクション空間を制限し、関節のPDターゲットを選択することは現実世界での安定した学習にとって重要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。