Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Navigate in Indoor Environments: from Memorizing to Reasoning

Liulong Ma, Yanjie Liu|arXiv (Cornell University)|Apr 15, 2019
Reinforcement Learning in Robotics参考文献 22被引用数 15
ひとこと要約

本論文では、RGB画像とオドメトリのみを用いて、記憶した経路を超えた一般化を可能にするスタックドLSTMアーキテクチャを活用し、未確認の屋内ゴールに到達できる深層強化学習ベースのナビゲーションプランナを提案する。モデルは、シミュレーションおよび実世界環境の両方で、新しいターゲットに対するゼロショット一般化を達成し、記憶に依存するのではなく、視覚的観察に基づく推論を実現している。

ABSTRACT

Autonomous navigation is an essential capability of smart mobility for mobile robots. Traditional methods must have the environment map to plan a collision-free path in workspace. Deep reinforcement learning (DRL) is a promising technique to realize the autonomous navigation task without a map, with which deep neural network can fit the mapping from observation to reasonable action through explorations. It should not only memorize the trained target, but more importantly, the planner can reason out the unseen goal. We proposed a new motion planner based on deep reinforcement learning that can arrive at new targets that have not been trained before in the indoor environment with RGB image and odometry only. The model has a structure of stacked Long Short-Term memory (LSTM). Finally, experiments were implemented in both simulated and real environments. The source code is available: https://github.com/marooncn/navbot.

研究の動機と目的

  • 屋内環境において未確認のゴールに一般化できるマップフリーなナビゲーションシステムの開発。
  • 特定の経路を記憶するのではなく、視覚的観察に基づいて推論できるロボットの実現。
  • 事前構築されたマップに依存せず、RGB画像とオドメトリのみで動作するモーションプランナの設計。
  • シミュレーションおよび実世界の屋内環境の両方で、モデルの一般化能力の検証。

提案手法

  • 計画者は、事前構築された環境マップを必要とせず、観察を行動にマッピングするための深層強化学習フレームワークを用いる。
  • スタックド長短期記憶(LSTM)ネットワークが、時系列的な視覚的およびオドメトリック入力を処理し、時間的依存性をモデル化する。
  • エージェントは、ゴール位置に到達するためのスパarsely denseな報酬を最大化するように強化学習により訓練される。
  • アーキテクチャにより、過去の観察と行動の記憶を保持することで、視覚的文脈に基づく推論が可能になる。
  • ドメインランダマイゼーションを最小限に抑えて、シミュレーション環境での訓練後、実世界への移行を実施する。
  • 訓練中に見られなかった新しいゴール位置への到達能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、事前の記憶なしに、未訓練の屋内環境の新しいゴールに到達できるか?
  • RQ2RGBとオドメトリのみを用いて、エージェントは見たことがある場所から未確認のゴール位置へどの程度一般化できるか?
  • RQ3スタックドLSTMアーキテクチャは、ナビゲーションのための視覚的シーケンスの推論をどの程度効果的に可能にするか?
  • RQ4提案手法は、明示的なマップ監視なしに、実世界の屋内環境でも頑健なパフォーマンスを達成できるか?

主な発見

  • モデルは、シミュレーションおよび実世界環境の両方で、以前に確認されていなかったゴールに到達でき、ゼロショット一般化を示した。
  • スタックドLSTMアーキテクチャにより、エージェントは時系列的な視覚的観察に基づいた推論が可能となり、記憶に依存する一般化を超えて性能が向上した。
  • 訓練例とは大きく異なるゴール位置であっても、新しいターゲットに到達する成功率が非常に高かった。
  • シミュレーションから実世界への展開において、最小限のドメイン適応で効果的な一般化が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。