Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Navigation in Unknown Environments using Neural Networks

Arbaaz Khan, Clark Zhang|ArXiv.org|Jul 24, 2017
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、未知の環境における長い死に胡同のナビゲーションを解決するために、値反復ネットワーク(VIN)に微分可能なメモリ(LSTM)を組み合わせたエンド・ツー・エンドのナビゲーション方策を提案する。過去のセンサー履歴を学習することで、20ユニットのパスで学習した後、200ユニットまでの未学習な胡同長さに一般化でき、教師ありおよび強化学習のベースラインを上回る性能を発揮する。

ABSTRACT

We investigate how a neural network can learn perception actions loops for navigation in unknown environments. Specifically, we consider how to learn to navigate in environments populated with cul-de-sacs that represent convex local minima that the robot could fall into instead of finding a set of feasible actions that take it to the goal. Traditional methods rely on maintaining a global map to solve the problem of over coming a long cul-de-sac. However, due to errors induced from local and global drift, it is highly challenging to maintain such a map for long periods of time. One way to mitigate this problem is by using learning techniques that do not rely on hand engineered map representations and instead output appropriate control policies directly from their sensory input. We first demonstrate that such a problem cannot be solved directly by deep reinforcement learning due to the sparse reward structure of the environment. Further, we demonstrate that deep supervised learning also cannot be used directly to solve this problem. We then investigate network models that offer a combination of reinforcement learning and supervised learning and highlight the significance of adding fully differentiable memory units to such networks. We evaluate our networks on their ability to generalize to new environments and show that adding memory to such networks offers huge jumps in performance

研究の動機と目的

  • 従来のSLAMベースのマッピングがドリフトのため失敗する、凸型の局所的最小値(例:死に胡同)を有する未知の環境でのナビゲーションの課題に対処する。
  • 明示的なマップ表現なしに、エンド・ツー・エンドの深層強化学習または教師あり学習が、順序付けられたナビゲーションを解決できるかを調査する。
  • 記憶が、学習分布を超えたより長い未学習の胡同への一般化を可能にする役割を探索する。
  • 値反復ネットワークと微分可能なメモリユニットを組み合わせることで、頑健で一般化可能なナビゲーション方策を実現できることを示す。

提案手法

  • 離散的アクション(上、下、左、右)と距離センサー入力を用いた2次元グリッドワールドシミュレータを用い、ロボットの認識をモデル化する。
  • 学習された報酬事前分布を用いて、経路計画のための値反復を近似する価値反復ネットワーク(VIN)を訓練する。
  • 注目モジュールの後に長短記憶(LSTM)層を追加し、順序的なセンサー履歴を符号化する。
  • 固定長(20ユニット)の胡同経路に対してA*プランナからの教師あり監視を用いて、VIN+LSTMモデルをエンド・ツー・エンドで訓練する。
  • 再訓練なしに、長さが増加する胡同(最大500ユニット)でテストすることで一般化性能を評価する。
  • DQN、CNN、CNN+LSTM、および手作業で作成した部分マップを備えたVINと比較し、記憶とアーキテクチャの影響を隔離する。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、報酬が疎で複雑な局所的最小値を有する未知の環境において、報酬が疎で複雑な局所的最小値を有する未知の環境において、エンド・ツー・エンドのナビゲーションを解決できるか?
  • RQ2センサー入力が入り口と出口で同一である場合、完全に畳み込み型の教師あり学習モデルは、より長い胡同に一般化できるか?
  • RQ3値反復ネットワークにLSTMメモリモジュールを追加することで、未学習のより長い胡同への一般化が可能になるか?
  • RQ4VIN+LSTMの性能は、手作業で作成した部分マップにアクセスするモデルと比べてどうか?
  • RQ5LSTMやDNCのような微分可能なメモリ機構は、順序決定タスクにおけるナビゲーションの頑健性を向上させられるか?

主な発見

  • DQNおよび標準的なCNNベースのモデルは完全に失敗し、報酬が疎くセンサー入力が曖昧なため、胡同ナビゲーションで0%の成功率を示した。
  • CNN+LSTMモデルは40%の成功率を達成したが、20ユニットまでの胡同にしか一般化できず、固定された曲がり角距離を学習したにすぎないことが示唆された。
  • 手作業で作成した部分マップを備えたVINは100%の成功を達成し、500ユニットまでの胡同に一般化でき、過去の観測記憶が極めて重要であることを証明した。
  • LSTM層を備えたVINは100%の成功を達成し、190ユニットまでの胡同に一般化でき、CNN+LSTMを著しく上回り、効果的な記憶統合を示した。
  • LSTM層はVINアーキテクチャの注目モジュールの後に配置した場合に最も良好に機能し、アーキテクチャの感受性を強調した。
  • Differentiable Neural Computer(DNC)を用いた初期実験では、LSTMを上回る性能が得られ、今後の研究においてより高度なメモリ機構の可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。