Skip to main content
QUICK REVIEW

[論文レビュー] Robot Navigation with Map-Based Deep Reinforcement Learning

Guangda Chen, Lifan Pan|arXiv (Cornell University)|Feb 11, 2020
Reinforcement Learning in Robotics参考文献 25被引用数 8
ひとこと要約

本稿では、curriculum learning と prioritized experience replay を用いた dueling double DQN を用いて、エゴセントリックな局所占有マップを直接ステアリングコマンドにマップする、マップベースの深層強化学習アプローチを提案する。この手法は、シミュレーションおよび実世界での展開において、障害物回避を安定的かつリアルタイムで実現し、先行するDRLベースのモデルに比べ、成功確率、滑らかさ、ノイズ耐性の面で優れた性能を達成した。

ABSTRACT

This paper proposes an end-to-end deep reinforcement learning approach for mobile robot navigation with dynamic obstacles avoidance. Using experience collected in a simulation environment, a convolutional neural network (CNN) is trained to predict proper steering actions of a robot from its egocentric local occupancy maps, which accommodate various sensors and fusion algorithms. The trained neural network is then transferred and executed on a real-world mobile robot to guide its local path planning. The new approach is evaluated both qualitatively and quantitatively in simulation and real-world robot experiments. The results show that the map-based end-to-end navigation model is easy to be deployed to a robotic platform, robust to sensor noise and outperforms other existing DRL-based models in many indicators.

研究の動機と目的

  • 未知の障害物を含む動的でごみだらけの環境における安全かつ堅牢な移動ロボットナビゲーションの課題に対処すること。
  • 手動によるパrameterチューニングに依存する従来のナビゲーション手法が、未確認のシナリオに一般化できないという限界を克服すること。
  • シミュレーションから実世界への展開にうまく一般化できる、サンプル効率の高いエンドツーエンドの深層強化学習ポリシーを開発すること。
  • センサーノイズに強く、完璧な認識や広範な手動ラベリングを必要としない、リアルタイムで反応的なナビゲーションを可能にすること。
  • 占有マップ入力を用いて、トレーニング済みのポリシーをシミュレーションから実ロボットプラットフォームにシームレスに転送できること。

提案手法

  • 2次元レーザースキャンから得られるエゴセントリックな局所占有マップを入力として、ロボットの即時の環境を表現する。
  • 状態と行動の値を分離することでサンプル効率を向上させる、dueling double DQNアーキテクチャを採用してQ値を推定する。
  • 学習を高影響の経験に集中させるために、prioritized experience replayを統合し、収束を加速する。
  • 訓練中に環境の複雑さを段階的に増加させることで、curriculum learningを適用し、ポリシーの一般化を向上させる。
  • ゴール到達と障害物回避を促進するために、密な報酬、スパarsな報酬、形状報酬を組み合わせて、シミュレーテッド環境でポリシーを訓練する。
  • トレーニング済みのポリシーを、Hokuyo UTM-30LX レーザーランジファーライ装備の実世界の差動駆動ロボットに直接転送する。

実験結果

リサーチクエスチョン

  • RQ1マップベースのエンドツーエンドDRLポリシーは、最小限の人的介入で、複雑で動的な環境において、堅牢かつリアルタイムのナビゲーションを達成できるか?
  • RQ2curriculum learningは、標準的な訓練と比較して、DRLベースのナビゲーションポリシーのサンプル効率と一般化性能をどのように向上させるか?
  • RQ3本手法は、センサーノイズや環境の不確実性を伴う実世界への展開において、どの程度シミュレーションから一般化できるか?
  • RQ4成功確率と軌道の滑らかさの観点から、本手法のマップベースDRLポリシーは、VFH や他のDRLベースラインと比較して、どの程度優れているか?
  • RQ5センサーノイズが、学習済みポリシーの耐性に与える影響は何か? また、従来の反応型手法と比較して、その影響はどの程度か?

主な発見

  • curricular DQNポリシーは、複雑な障害物シナリオで94%の成功率を達成し、通常のDQN(91%)やPPO with 1D conv(85%)を上回った。
  • curricular DQNは平均到達ステップ数を26.13にまで低減し、PPO(40.19)や通常のDQN(27.76)よりも顕著に効率的なナビゲーションを示した。
  • 平均角速度変化は0.35であり、PPO(0.46)や通常のDQN(0.39)と比較して、より滑らかな軌道を示した。
  • ノイズのあるセンサー入力でトレーニングされたDQNポリシーは、実世界の条件にうまく一般化し、ノイズの強いレーザーデータ下でも高い成功率を維持した。
  • 本手法は、レーザーノイズに対して強く、従来のVFH手法と比較して、性能低下がはるかに小さかった。
  • 実世界の実験では、障害物や歩行者がいる通路内でもナビゲーションが成功しており、ポリシーの転送性とリアルタイム性能が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。