Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Visually Navigate in Photorealistic Environments Without any Supervision

Lina Mezghani, Sainbayar Sukhbaatar|arXiv (Cornell University)|Apr 10, 2020
Multimodal Machine Learning Applications参考文献 40被引用数 9
ひとこと要約

本論文は、外部の報酬や教師信号を一切使用せず、RGB観測のみを用いて、写真のようにリアルな環境における視覚的ナビゲーションのための自己教師付きで3段階のフレームワークを提案する。この手法は、視覚的表現を学習し、離散的な内発的報酬を用いたシーンメモリバッファを通じて探索を行い、自己生成されたゴールを用いてナビゲーション方策を訓練する。Gibsonデータセットにおいて、教師ありベースラインと同等の性能を達成する。

ABSTRACT

Learning to navigate in a realistic setting where an agent must rely solely on visual inputs is a challenging task, in part because the lack of position information makes it difficult to provide supervision during training. In this paper, we introduce a novel approach for learning to navigate from image inputs without external supervision or reward. Our approach consists of three stages: learning a good representation of first-person views, then learning to explore using memory, and finally learning to navigate by setting its own goals. The model is trained with intrinsic rewards only so that it can be applied to any environment with image observations. We show the benefits of our approach by training an agent to navigate challenging photo-realistic environments from the Gibson dataset with RGB inputs only.

研究の動機と目的

  • 写真的リアリズム環境において、外部の教師信号や報酬が一切ない状態でも動作可能なナビゲーションエージェントの開発を目的とする。
  • RGB入力のみを用いて、近くの場所と遠くの場所を区別できる視覚的表現を学習できるようにすることを目的とする。
  • 連続的な内発的報酬に依存しないで、シーンメモリバッファを用いて探索を誘導する探索方策を学習することを目的とする。
  • 自己生成されたゴールとメモリバッファを用いた内発的形状付けを用いて、目的指向のナビゲーション方策を学習することを目的とする。
  • 複雑で現実世界に類似した環境において、一般化性能と教師あり手法と同等の性能を示すことを目的とする。

提案手法

  • エージェントは、近くの画像ペアと遠く離れた画像ペアを区別する対照学習の目的関数を用いて、視覚的表現を最初に学習する。
  • 特徴表現がバッファ内のすべての既存エントリと類似しない場合に限り、状態をシーンメモリバッファ(SMB)に追加することで、エージェントは探索を行う。
  • 連続的報酬関数が局所最適に陥る原因となるのを避けるために、離散的な内発的報酬が使用される。
  • ナビゲーション方策は、SMB上のトランスフォーマー型アテンションメカニズムを用いて、自己生成されたゴールに向かう行動を選択する。
  • 位置情報、深度情報、外部報酬へのアクセスなしに、エージェント全体が自己教師付きでエンドツーエンドに訓練される。
  • SMBは二重の役割を果たす:内発的報酬の形状付けと、探索およびナビゲーション方策の両方の文脈提供。

実験結果

リサーチクエスチョン

  • RQ1エージェントは、外部の教師信号や報酬が一切ない状態でも、RGB観測のみを用いて写真的リアリズム環境でのナビゲーションを学習できるか?
  • RQ2複雑な環境において、局所最適を回避し、高いカバレッジを達成できる内発的探索をどのように設計できるか?
  • RQ3自己教師付きの視覚的表現モデルは、真の教師信号が存在しない状況でも、効果的なナビゲーションを支えるのに十分な一般化性能を発揮できるか?
  • RQ4明示的な教師信号がない状況下で、メモリベースのアテンションメカニズムは、探索およびナビゲーション性能をどの程度向上できるか?
  • RQ5自己教師付きエージェントは、挑戦的で現実世界に類似した環境において、教師ありベースラインと同等の性能を達成できるか?

主な発見

  • 提案手法は、カバレッジを直接最適化する教師ありオラクルエージェントと同等の探索カバレッジを達成しており、教師なし探索における優れた性能を示している。
  • 離散的な内発的報酬の使用は、連続的報酬に比べて顕著に優れており、連続的報酬は報酬の利用によって局所領域に閉じ込められてしまう原因となる。
  • エージェントは、ボールウ環境の可視化結果からも示されるように、探索中に環境のトポロジカルに一貫したグラフを成功裏に構築した。
  • アブレーションスタディの結果、離散的報酬およびSMB上でのアテンションメカニズムが、効果的な探索に不可欠であることが確認された。
  • 最終的なナビゲーション方策は、未知の環境における新たなテストゴールに対しても一般化できており、自己教師付きアプローチの堅牢性を示している。
  • モデルは、外部の教師信号や報酬信号を一切使用しない状態でも、Gibsonデータセットにおいてすべてのベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。