Skip to main content
QUICK REVIEW

[論文レビュー] From Pixels to Legs: Hierarchical Learning of Quadruped Locomotion

Deepali Jain, Atıl Işçen|arXiv (Cornell University)|Nov 23, 2020
Robot Manipulation and Learning参考文献 34被引用数 18
ひとこと要約

本稿では、四足歩行ロボットが生のピクセルから、同時に歩行と視覚ベースのナビゲーションを学習できる階層的強化学習(HRL)フレームワークを提案する。視覚処理(1.5–10 Hz)を低レベルのモータ制御(500 Hz)から、潜在的コマンド空間を介して分離することで、効率的でデータに効率的な学習が可能となり、非階層的ベースラインと比較して計算負荷を低減し、低レベルポリシーのタスク間での転送が可能になる。

ABSTRACT

Legged robots navigating crowded scenes and complex terrains in the real world are required to execute dynamic leg movements while processing visual input for obstacle avoidance and path planning. We show that a quadruped robot can acquire both of these skills by means of hierarchical reinforcement learning (HRL). By virtue of their hierarchical structure, our policies learn to implicitly break down this joint problem by concurrently learning High Level (HL) and Low Level (LL) neural network policies. These two levels are connected by a low dimensional hidden layer, which we call latent command. HL receives a first-person camera view, whereas LL receives the latent command from HL and the robot's on-board sensors to control its actuators. We train policies to walk in two different environments: a curved cliff and a maze. We show that hierarchical policies can concurrently learn to locomote and navigate in these environments, and show they are more efficient than non-hierarchical neural network policies. This architecture also allows for knowledge reuse across tasks. LL networks trained on one task can be transferred to a new task in a new environment. Finally HL, which processes camera images, can be evaluated at much lower and varying frequencies compared to LL, thus reducing computation times and bandwidth requirements.

研究の動機と目的

  • 生の視覚入力から複雑な環境における動的四足歩行と視覚ベースのナビゲーションを、四足歩行ロボットが同時に学習できるようにすること。
  • 高次元の視覚観測と高速で接触が豊富な脚のダイナミクスを1つのポリシーに統合する課題に対処すること。
  • 高レベルの視覚意思決定と低レベルのモータ制御を分離することで、データ効率と学習速度を向上させること。
  • 異なるナビゲーションタスクや環境間で低レベルポリシーを転送することで、知識の再利用を可能にすること。
  • 高レベルポリシーを可変で低周波数で実行することで、計算コストを低減しつつタスクパフォーマンスを維持すること。

提案手法

  • フレームワークは、高レベル(HL)ポリシーがファーストパーソンカメラの画像を処理し、低レベル(LL)ポリシーが潜在的コマンドに基づいてアクチュエータを制御する階層的アーキテクチャを採用する。
  • HLネットワークは、LLポリシーのための時間的に抽象化された行動としての低次元の潜在的コマンド(1–8次元)を出力する。
  • LLポリシーは500 Hzで実行され、潜在的コマンドとオンボードセンサーフィードバックに基づいてモータコマンドを実行する。
  • HLポリシーは、可変で稀な間隔(1.5–10 Hz)で視覚入力を処理するように訓練され、計算負荷を低減する。
  • 全システムは、LaikagoロボットのリアルなPyBulletシミュレーション上で、エボリューション戦略(ES)を用いて訓練される。
  • 潜在的コマンド空間は情報ボトルネックとして機能し、HLが関連する視覚特徴のみを抽出し、LLがタスク関連の歩行プリミティブを学習するのを促進する。

実験結果

リサーチクエスチョン

  • RQ11つの階層的強化学習ポリシーが、生のピクセルから視覚ベースのナビゲーションと動的四足歩行を同時に学習できるか?
  • RQ2高レベルの視覚処理と低レベルの制御を分離することで、データ効率と学習速度が向上するか?
  • RQ3低レベルの歩行ポリシーは、異なる環境やタスク間で転送可能か?
  • RQ4高レベルポリシーが低周波数かつ可変周波数で実行されても、パフォーマンスが著しく低下しない程度にまで可能か?
  • RQ5潜在的コマンド空間に出現する歩行プリミティブは、意味的で制御可能な行動に対応しているか?

主な発見

  • 階層的ポリシーは、3つの視覚ナビゲーションタスクにおいて非階層的ベースラインを上回り、より高いデータ効率と短いウォールクロック学習時間を達成した。
  • 可変周波数の高レベルネットワーク(1.5–10 Hz)を用いることで、毎時刻にHLを実行する場合と比較して推論時間を約100倍短縮した。
  • 2次元の潜在的コマンド空間が最適なパフォーマンスを達成し、低次元の潜在的空間が効果的で解釈可能かつ転送可能な歩行プリミティブを可能にしていることを示した。
  • ある環境(例:カーブした崖)で訓練された低レベルポリシーは、新しい環境(例:迷路)へと成功裏に転送され、データ効率が向上した。
  • 高レベルポリシーは、必要な場合にのみ視覚入力を処理するよう学習し、計算と帯域幅の要件を低減しながらも、タスクパフォーマンスを維持した。
  • 潜在的コマンド空間の可視化により、旋回や速度変更といった歩行行動の間で滑らかな遷移が観察され、意味的で連続的な制御プリミティブの出現が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。