Skip to main content
QUICK REVIEW

[論文レビュー] PPMC RL Training Algorithm: Rough Terrain Intelligent Robots through Reinforcement Learning

Tamir Blum, Kazuya Yoshida|arXiv (Cornell University)|Mar 2, 2020
Robotic Path Planning Algorithms参考文献 16被引用数 5
ひとこと要約

本論文では、不整な不規則な地形におけるエンドツーエンドのナビゲーションと制御を学習できる汎用的なRLベースのフレームワークである、経路計画および運動制御強化学習(PPMC RL)トレーニングアルゴリズムを紹介する。本手法は、車輪式および四足歩行ロボットの両方において、未学習の不規則な地形マップへ100%の成功で一般化を達成し、事前の環境知識なしに、頑健な一般化と運動制御を実現している。

ABSTRACT

Robots can now learn how to make decisions and control themselves, generalizing learned behaviors to unseen scenarios. In particular, AI powered robots show promise in rough environments like the lunar surface, due to the environmental uncertainties. We address this critical generalization aspect for robot locomotion in rough terrain through a training algorithm we have created called the Path Planning and Motion Control (PPMC) Training Algorithm. This algorithm is coupled with any generic reinforcement learning algorithm to teach robots how to respond to user commands and to travel to designated locations on a single neural network. In this paper, we show that the algorithm works independent of the robot structure, demonstrating that it works on a wheeled rover in addition the past results on a quadruped walking robot. Further, we take several big steps towards real world practicality by introducing a rough highly uneven terrain. Critically, we show through experiments that the robot learns to generalize to new rough terrain maps, retaining a 100% success rate. To the best of our knowledge, this is the first paper to introduce a generic training algorithm teaching generalized PPMC in rough environments to any robot, with just the use of reinforcement learning.

研究の動機と目的

  • 不規則で不整な地形における経路計画と運動制御の一般化を可能にする汎用的な強化学習トレーニングアルゴリズムの開発。
  • PPMC RLアルゴリズムがロボットの構成や歩行モードに依存せず、四足歩行ロボットに限らない既存の研究を拡張することの証明。
  • 訓練環境よりも困難な未学習の高不規則な地形マップへの一般化能力の検証。
  • 月面表面の模擬を含む、実世界に近いシミュレーションシナリオにおいて、純粋な強化学習トレーニングにより高い信頼性と成功確率を達成すること。
  • 単一のニューラルネットワークを用いてナビゲーションと制御をエンドツーエンドで学習し、手作業で設計された制御システムへの依存を低減すること。

提案手法

  • PPMC RLトレーニングアルゴリズムは、エージェント、ユーザー、環境の3要素を持つ三値強化学習アーキテクチャを用い、経路計画と運動制御を1つのディープ強化学習ポリシーに統合する。
  • アルゴリズムは、ユーザーが指定したゴールに到達し、障害物を避けながら不規則な地形でも安定性を保つように導く報酬関数を用いる。
  • トレーニングは、月面の状態を模倣する高不規則で険しい地形マップ(マップ1)を備えたシミュレーテッド環境で実施される。
  • ポリシーは、安定的かつ効率的なディープ強化学習トレーニングを可能にする信頼領域法であるACKTRアルゴリズムを用いて訓練される。
  • 一般化性能は、新たに未学習の不規則な地形マップ(マップ2およびマップ3)上で評価され、多様で複雑な地形形状での性能がテストされる。
  • 本手法は、車輪式のCLOVERローバーおよび事前に検証済みの四足歩行ロボットの両方で検証され、アーキテクチャの独立性が確認された。

実験結果

リサーチクエスチョン

  • RQ11つの強化学習ベースのトレーニングアルゴリズムが、未学習の不規則な地形における経路計画と運動制御の一般化を可能にするか。
  • RQ2PPMC RLアルゴリズムが、車輪式および脚部プラットフォームを含む異なるロボット形状においても高い性能を維持するか。
  • RQ3エージェントが、純粋な強化学習のみを用いて、複雑で不規則な地形における時計回りおよび反時計回りの旋回を学習できるか。
  • RQ4エンドツーエンドの強化学習のみを用いて、多様で未学習の不規則な地形マップにおいて100%のナビゲーション成功率を達成できるか。
  • RQ5本アルゴリズムは、手作業で設計された制御システムや環境特化のチューニングへの依存をどの程度低減できるか。

主な発見

  • PPMC RLトレーニングアルゴリズムは、未学習の不規則な地形マップ3つ(各マップに4つの出発位置を設定)の合計12テストケースにおいて100%の成功率を達成し、頑健な一般化を示した。
  • 本アルゴリズムは、車輪式ローバー(CLOVER)および四足歩行ロボットの両方を用いて、複雑で不規則な地形を効果的にナビゲート可能であり、ロボットアーキテクチャに依存しないことを確認した。
  • エージェントは、不規則な地形において時計回りおよび反時計回りの旋回を学習し、効果的な運動制御の学習が可能であることを示した。
  • 訓練環境よりも粗い、あるいは粗さが小さい地形に対しても一般化が可能であり、環境変動に対するレジリエンスを示した。
  • エキスパートのデモンストレーションやハイブリッド制御システムを一切必要とせず、純粋な強化学習に依存して高い信頼性と性能を維持した。
  • 本結果は、複数のロボットタイプおよび未学習のマップを対象として、純粋な強化学習ベースの一般化が達成された最初の事例である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。