Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Navigate Using Mid-Level Visual Priors

Alexander F. Sax, Jeffrey O. Zhang|arXiv (Cornell University)|Dec 23, 2019
Reinforcement Learning in Robotics参考文献 52被引用数 12
ひとこと要約

本論文は、ロボットナビゲーションの強化学習方策に中間レベルの視覚的事前知識(深度推定、エッジ検出、セマンティックセグメンテーションなど)を統合することを提案する。生のピクセルではなく、事前学習済みのビジョンモデルを用いて構造的な表現を抽出することで、本手法は、初期学習から学習するか、最先端の表現学習手法を用いる場合と比較して、より速い学習、環境間でのより優れた一般化、およびより高い最終的パフォーマンスを達成する。

ABSTRACT

How much does having visual priors about the world (e.g. the fact that the world is 3D) assist in learning to perform downstream motor tasks (e.g. navigating a complex environment)? What are the consequences of not utilizing such visual priors in learning? We study these questions by integrating a generic perceptual skill set (a distance estimator, an edge detector, etc.) within a reinforcement learning framework (see Fig. 1). This skill set ("mid-level vision") provides the policy with a more processed state of the world compared to raw images. Our large-scale study demonstrates that using mid-level vision results in policies that learn faster, generalize better, and achieve higher final performance, when compared to learning from scratch and/or using state-of-the-art visual and non-visual representation learning methods. We show that conventional computer vision objectives are particularly effective in this regard and can be conveniently integrated into reinforcement learning frameworks. Finally, we found that no single visual representation was universally useful for all downstream tasks, hence we computationally derive a task-agnostic set of representations optimized to support arbitrary downstream tasks.

研究の動機と目的

  • 中間レベルの視覚的事前知識を統合することで、視覚的運動強化学習におけるサンプル効率、一般化、および最終的パフォーマンスが向上するかどうかを調査すること。
  • 独立して訓練された従来のコンピュータビジョンの目的関数が、能動的強化学習タスクにおける効果的な知覚的事前知識として機能するかどうかを評価すること。
  • 一貫したタスクに依存しない中間レベルの表現セットが、多様な下流ナビゲーションタスクをサポートできるかどうかを特定すること。
  • 異なるナビゲーションおよび探索タスクにおいて、セマンティック表現と幾何的表現の有効性を比較すること。
  • 中間レベルのビジョンが、報酬形状なしに、意図しないが有益な行動の出現を促すかどうかを評価すること。

提案手法

  • 本手法は、標準的なコンピュータビジョンタスク(例:深度推定、インスタンスセグメンテーションなど)のための事前学習済みニューラルネットワークを用いて、生画像から中間レベルの視覚的特徴を抽出する。
  • これらの特徴は、強化学習方策の観測として使用され、生のピクセル入力に代わる。
  • 本手法は、Gibson、Habitat、ViZDoomの3つの環境で、24種類の異なる中間レベルの視覚的表現を用いて評価される。
  • タスクに依存しない表現セットを、多様な知覚的ニーズを網羅するように計算的に導出するために、最大カバレッジ特徴選択アルゴリズムが用いられる。
  • ナビゲーションおよび探索タスクの両方において、成功確率、SPL、衝突回数、および1エピソードあたりの報酬といった標準的な指標を用いてパフォーマンスを評価する。
  • 10個の異なるランダムシードごとに、クラスタ効果補正付きウィルコクソン順位和検定を用いて統計的有意性を評価する。

実験結果

リサーチクエスチョン

  • RQ1中間レベルの視覚的事前知識を用いることで、視覚的運動強化学習におけるサンプル効率と最終的パフォーマンスが向上するか?
  • RQ2ナビゲーションタスクと探索タスクにおいて、セマンティック表現と幾何的表現の有効性はどのように比較されるか?
  • RQ3一貫したタスクに依存しない中間レベルの表現セットが、多様な下流タスクに一般化できるか?
  • RQ4中間レベルの視覚的特徴が、報酬関数によって明示的に形状づけられていない行動の出現を促すか?
  • RQ5報酬形状なしに、生のピクセルから直接学習することは、最先端の表現学習手法を用いても、中間レベルのビジョン表現を用いる場合よりも効果が悪いのか?

主な発見

  • 中間レベルの視覚的事前知識を用いて訓練された方策は、生のピクセルから学習する場合や最先端の表現学習手法を用いる場合と比較して、顕著に高い最終的パフォーマンスを達成した。
  • 中間レベルのビジョンにより、サンプル効率が向上し、方策がより速く収束し、環境との相互作用回数が少なくてもよくなった。
  • 視覚的ドメインシフトを伴う環境間での一般化は、中間レベルの表現を用いた場合、生のピクセルを用いた場合と比較して顕著に優れていた。
  • 最も優れたパフォーマンスを示した中間レベルの特徴はタスク依存的であった:ナビゲーションタスクではセマンティック特徴が幾何的特徴を上回り、探索タスクでは逆に幾何的特徴がセマンティック特徴を上回った。
  • 計算的に多様な知覚的ニーズを網羅するように導出された最大カバレッジ特徴セットは、ランダムに選択された特徴セットを上回り、最良の個別特徴と同等またはそれを上回るパフォーマンスを示した。
  • 報酬形状なしに、中間レベルのビジョンを用いて訓練された方策は、効率的な経路計画や障害物回避といった望ましい行動を示したため、発現的(emergent)な能力が存在することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。