Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Terrain Generalization for Visual Locomotion Policies

Alejandro Escontrela, George Yu|arXiv (Cornell University)|Nov 11, 2020
Robotic Locomotion and Control参考文献 26被引用数 8
ひとこと要約

本論文では、手続き的地形生成と生のLiDAR入力を用いたマルチタスク強化学習を活用し、地面の高さマップや手動による認識前処理に依存せずに、13種類の多様な地形—階段、険しい地形、動的かつ不規則な屋内環境を含む—において強力なゼロショット一般化を達成するエンドツーエンドの視覚的移動方策を提案している。

ABSTRACT

Legged robots have unparalleled mobility on unstructured terrains. However, it remains an open challenge to design locomotion controllers that can operate in a large variety of environments. In this paper, we address this challenge of automatically learning locomotion controllers that can generalize to a diverse collection of terrains often encountered in the real world. We frame this challenge as a multi-task reinforcement learning problem and define each task as a type of terrain that the robot needs to traverse. We propose an end-to-end learning approach that makes direct use of the raw exteroceptive inputs gathered from a simulated 3D LiDAR sensor, thus circumventing the need for ground-truth heightmaps or preprocessing of perception information. As a result, the learned controller demonstrates excellent zero-shot generalization capabilities and can navigate 13 different environments, including stairs, rugged land, cluttered offices, and indoor spaces with humans.

研究の動機と目的

  • 多様な不規則な地形において、手動による工学的設計を一切行わずに、脚部ロボットの一般化を達成する課題に対処すること。
  • 従来の強化学習方策が未確認環境への一般化が不十分であるか、タスク固有のチューニングを必要としているという制限を克服すること。
  • 1つの移動方策が、多様で現実的かつ未確認の地形において効果的に動作できる学習システムを開発すること。
  • 外知覚(LiDAR)と軌道制御型方策アーキテクチャを統合することで、ゼロショット一般化が著しく向上することを示すこと。

提案手法

  • 各タスクが異なる地形タイプに対応する部分的に観測可能なマルコフ決定過程(POMDP)として脚部移動を定式化する。
  • 複雑な屋内外の障害物や動的要素を含む、多様で現実的な訓練環境を効率的に生成するための手続き的地形生成器を設計する。
  • 地面の高さマップの事前処理を回避し、生のLiDARスキャンと本体の自己認識状態を直接低レベルモーター制御にマッピングするエンドツーエンドの視覚的移動方策を実装する。
  • ポリシー制御軌道生成(PMTG)フレームワークを統合し、滑らかで周期的かつ適応可能な歩行パターンを生成することで、方策のロバスト性を向上させる。
  • 継続的に多様な地形タイプにさらされるように、カリキュラム風のタスク分布を用いたマルチタスク強化学習で方策を訓練する。
  • 高精細な物理シミュレータと視覚的にリアルな屋内スキャンを用いて、訓練およびゼロショットテストの両状況で方策のパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク強化学習で訓練された1つの移動方策は、微調整なしに広範な未確認地形に一般化可能か?
  • RQ2反応型または自己認識のみのポリシーと比較して、生の外知覚LiDAR入力を組み込むことで、ゼロショット一般化性能にどのような影響を与えるか?
  • RQ3PMTGベースのポリシー・アーキテクチャは、標準的な反応型制御ポリシーと比較して、一般化性能と移動品質にどの程度向上効果をもたらすか?
  • RQ4多様で手続き的に生成された地形を用いたマルチタスク訓練は、劣化記憶を防ぎ、逐次的訓練よりも優れた一般化をもたらすか?
  • RQ5提案された視覚的移動方策は、動く人間がいるような複雑でごみだらけの動的屋内環境(オフィスなど)を効果的に走破できるか?

主な発見

  • 提案された視覚的移動方策は、未確認の険しい山岳地形において平均67%のタスク完了率を達成し、単一地形向けポリシー(最大28%)を著しく上回った。
  • マルチタスク強化学習と手続き的地形生成を用いて訓練されたポリシーは、階段、迷路、森林、動的屋内シーンを含む13種類の多様な環境において強いゼロショット一般化を示した。
  • LiDAR入力を除去すると一般化性能が著しく低下し、複雑で幾何学的に多様な地形を走破するには外知覚が不可欠であることが確認された。
  • PMTGベースのポリシーを反応型ポリシーに置き換えると、パフォーマンス低下が28%から218%にまで上昇し、構造的な歩行パターン生成がロバスト性と一般化性能を向上させることを示した。
  • 逐次的訓練(1つのタスクずつ)では劣化記憶が発生し、一般化性能が著しく低下した。これは、効果的なポリシー移転のためには同時にマルチタスク訓練を行う必要があることを確認した。
  • 視覚的移動方策は、より滑らかで適応性のある歩行パターンを生成する—例えば、不整地の地形では足場の位置を調整する—これにより、崖や険しい道のような挑戦的な環境でも安定した走破が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。