Skip to main content
QUICK REVIEW

[論文レビュー] On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach

Nicolò Botteghi, Beril Sırmaçek|arXiv (Cornell University)|Feb 10, 2020
Robotic Path Planning Algorithms参考文献 14被引用数 18
ひとこと要約

本論文は、訓練中にSLAMから得られる障害物の知識を報酬関数に組み込むことで、地図なしの深層強化学習(DRL)による移動ロボットのナビゲーション方策を提案する。リアルタイムで地図に基づく障害物の確信度を報酬に取り入れることで、エージェントはより安全で、効率的なナビゲーションを学習し、未確認の環境において36.9%高速に収束し、23–45%高い成功確率を達成する。さらに、シミュレーションで学習した方策を、微調整なしに実際のロボットにゼロショットで転送することに成功した。

ABSTRACT

We present a map-less path planning algorithm based on Deep Reinforcement Learning (DRL) for mobile robots navigating in unknown environment that only relies on 40-dimensional raw laser data and odometry information. The planner is trained using a reward function shaped based on the online knowledge of the map of the training environment, obtained using grid-based Rao-Blackwellized particle filter, in an attempt to enhance the obstacle awareness of the agent. The agent is trained in a complex simulated environment and evaluated in two unseen ones. We show that the policy trained using the introduced reward function not only outperforms standard reward functions in terms of convergence speed, by a reduction of 36.9\% of the iteration steps, and reduction of the collision samples, but it also drastically improves the behaviour of the agent in unseen environments, respectively by 23\% in a simpler workspace and by 45\% in a more clustered one. Furthermore, the policy trained in the simulation environment can be directly and successfully transferred to the real robot. A video of our experiments can be found at: https://youtu.be/UEV7W6e6ZqI

研究の動機と目的

  • 地図なしの移動ロボットナビゲーションにおけるサンプル効率と一般化性能の向上を目的とする。
  • DRLにおける報酬の疎らさの制限を、訓練中にSLAMから得られるリアルタイムの障害物認識を組み込むことで克服することを目的とする。
  • 微調整なしに、シミュレーションで学習した方策を実世界の差動駆動型ロボットにゼロショットで転送できることを目的とする。
  • 障害物の距離と確信度に基づく報酬形状によって、障害物回避性能と経路品質を向上させることを目的とする。
  • 訓練中にのみ使用される地図知識が、未確認の環境における性能向上に顕著に寄与することを示すこと

提案手法

  • 40次元のレーザースキャンとオドメトリを入力として、深層決定的方策勾配(DDPG)エージェントを訓練する。
  • グリッドベースのラオ・ブラックウェルト粒子フィルタが、訓練中に地図と障害物の確信度をオンラインで推定する。
  • 報酬関数は、センサーの視界内における障害物までの距離の逆数を、地図の事後確信度で重み付けして形状づける。
  • 地図は訓練中にのみ使用され、評価や実世界でのデプロイでは使用しない。
  • エージェントは、シミュレーテッド環境内での試行錯誤の相互作用を通じて、連続的な速度指令(線形および角速度)を学習する。
  • 訓練済みの方策は、ハイパーパramータの調整なしに、実際のClearpath Jackalロボットに直接転送された。

実験結果

リサーチクエスチョン

  • RQ1訓練中にリアルタイムで得られるSLAM由来の障害物の確信度をDRLの報酬関数に統合することで、地図なしナビゲーションにおける学習速度と収束性が向上するか?
  • RQ2訓練中に地図知識に基づく報酬形状が、未確認で複雑な環境への一般化性能を向上させるか?
  • RQ3シミュレーションで学習したDRL方策が、微調整なしに実世界環境を正常にナビゲートできるか?
  • RQ4提案手法による報酬形状は、標準的な疎な報酬と比較して、衝突をどれほど低減し、経路品質をどのように向上させるか?
  • RQ5報酬関数に障害物認識を組み込むことで、安全かつ効率的なナビゲーション行動がどの程度向上するか?

主な発見

  • 提案手法は、標準的な疎な報酬関数と比較して、訓練の反復ステップ数を36.9%削減した。
  • 主な訓練環境(Env-1)において、標準的手法と比較して25%高い成功確率を示した。
  • 未確認の環境では、より単純な作業環境(Env-2)で23%、よりクラスタリングが強い環境(Env-3)で45%の成功確率向上を達成した。
  • ゴールに到達するまでの平均アクション数は、Env-1で42.7減少し、Env-2とEnv-3ではそれぞれ64.2および13.2減少した。
  • シミュレーションから実際のClearpath Jackalロボットへの方策転送に成功し、実世界での微調整なしに衝突のないナビゲーションを達成した。
  • 地図に基づく障害物の確信度を報酬に統合することで、推論時にも地図にアクセスしない状態でも、事前に障害物を回避する安全な行動をエージェントが学習できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。