Skip to main content
QUICK REVIEW

[論文レビュー] Target Driven Visual Navigation with Hybrid Asynchronous Universal Successor Representations

Shamane Siriwardhana, Rivindu Weerasekera|arXiv (Cornell University)|Nov 27, 2018
Multimodal Machine Learning Applications参考文献 21被引用数 4
ひとこと要約

本論文は、写真のようにリアルな環境におけるターゲット駆動型ビジョナルナビゲーションを可能にする、新たな深層強化学習アーキテクチャであるハイブリッド非同期ユニバーサルスセセサ Representations (HAUSR) を提案する。この手法は、ユニバーサルスセセサ Representations と非同期アクタ・クリティック学習を組み合わせており、微調整なしで未学習のゴールに強い汎化性能を示し、転移学習による迅速な適応を可能にする。AI2THORシミュレーションにおいて、未確認のターゲットで高い成功確率を達成した。

ABSTRACT

Being able to navigate to a target with minimal supervision and prior knowledge is critical to creating human-like assistive agents. Prior work on map-based and map-less approaches have limited generalizability. In this paper, we present a novel approach, Hybrid Asynchronous Universal Successor Representations (HAUSR), which overcomes the problem of generalizability to new goals by adapting recent work on Universal Successor Representations with Asynchronous Actor-Critic Agents. We show that the agent was able to successfully reach novel goals and we were able to quickly fine-tune the network for adapting to new scenes. This opens up novel application scenarios where intelligent agents could learn from and adapt to a wide range of environments with minimal human input.

研究の動機と目的

  • 動的で現実世界に近い環境において、従来のマップベースおよびマップレスなビジョナルナビゲーション手法の一般化性能に限界があることに対処すること。
  • 再訓練なしに多様なナビゲーションゴールに一般化できるように、深層強化学習エージェントを開発すること。
  • ユニバーサルスセセサ Representations と非同期学習を組み合わせた安定的かつスケーラブルなアーキテクチャを構築し、複雑なビジョアルタスクに適応させること。
  • 効率的な転移学習を通じて、新しい環境やゴールへの迅速な適応を可能にすること。

提案手法

  • HAUSRフレームワークは、ユニバーサルスセセサ Representations (USR) と非同期アドバンテージアクタ・クリティック (A3C) 学習を統合し、複数のゴールにわたる転送可能な状態行動価値関数を学習する。
  • 訓練の安定化と一般化性能の向上を図るため、標準的な価値損失とスセセサ Representations (SR) 損失を組み合わせたハイブリッド損失関数を採用する。
  • 特定の報酬に依存しない環境のダイナミクスを捉える共有のスセセサ Representations を学習し、新しいゴールへの転送を可能にする。
  • 視覚的観測とスパarsな報酬を用いて、写真のようにリアルなシミュレーション環境 (AI2THOR) で訓練を行う。
  • 新しいゴールに対しては、報酬予測ヘッドの微調整のみを実施し、追加の訓練を最小限に抑えて迅速な適応を実現する。
  • 報酬形状とポリシー学習を分離することで、事前に学習されたダイナミクス表現を用いて未確認のターゲットに一般化可能である。

実験結果

リサーチクエスチョン

  • RQ1写真のようにリアルな環境において、追加の訓練なしに、深層強化学習エージェントが未学習のナビゲーションゴールに一般化できるか?
  • RQ2提案されたHAUSRアーキテクチャは、転移学習を用いて新しいゴールへの迅速な適応をどの程度効果的に可能にするか?
  • RQ3ユニバーサルスセセサ Representations は、標準的なDRLベースラインと比較して、高次元のビジョアルナビゲーションタスクにおける一般化性能を向上させられるか?
  • RQ4A3CとSR損失を組み合わせたハイブリッド訓練方式は、複雑な環境においてより安定的かつスケーラブルな学習を可能にするか?

主な発見

  • エージェントは、微調整なしにAI2THORのバスルーム環境で50の未学習のゴール位置に高い成功率で到達した。これは、強力なゼロショット一般化を示している。
  • モデルは、見た目が似ているが異なるターゲットを正しく区別できた。これは、強力な表現学習の能力を示している。
  • 転移学習により、15分未満の微調整で、以前は到達できなかったゴールへのナビゲーションを学習できた。これは、訓練時間の大幅な短縮を意味する。
  • SR損失は時間経過とともに安定し、ゼロに近づかなかった。これは、部分的なスセセサ Representations の学習でも、効果的な一般化が可能であることを示している。
  • 価値損失とSR損失の両方を含むハイブリッド訓練アプローチにより、安定した訓練ダイナミクスが得られ、標準的なA3Cよりも収束性と一般化性能が優れていた。
  • 従来、表形式または単純な環境でのみテストされたUSRを、複雑なシミュレーションにおける高次元連続的ビジョアルナビゲーションタスクに成功して拡張した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。