Skip to main content
QUICK REVIEW

[論文レビュー] Learning and Planning with a Semantic Model

Yi Wu, Yuxin Wu|arXiv (Cornell University)|Sep 28, 2018
Multimodal Machine Learning Applications参考文献 31被引用数 11
ひとこと要約

LEAPSは、高レベルの計画に軽量で解釈可能なベイジアン意味モデルを、低レベルの視覚的制御に学習されたマルチターゲット部分方策を用いるハイブリッドなモデルベースおよびモデルフリー強化学習フレームワークを提案する。LEAPSは、意味的規則性を活用し、ベイジアン推論により最小限の経験で意味モデルを動的に更新することで、未学習のHouse3D環境における視覚的ナビゲーションにおいて、特に長時間スケールタスクで強力なベースラインを上回る性能を発揮する。

ABSTRACT

Building deep reinforcement learning agents that can generalize and adapt to unseen environments remains a fundamental challenge for AI. This paper describes progresses on this challenge in the context of man-made environments, which are visually diverse but contain intrinsic semantic regularities. We propose a hybrid model-based and model-free approach, LEArning and Planning with Semantics (LEAPS), consisting of a multi-target sub-policy that acts on visual inputs, and a Bayesian model over semantic structures. When placed in an unseen environment, the agent plans with the semantic model to make high-level decisions, proposes the next sub-target for the sub-policy to execute, and updates the semantic model based on new observations. We perform experiments in visual navigation tasks using House3D, a 3D environment that contains diverse human-designed indoor scenes with real-world objects. LEAPS outperforms strong baselines that do not explicitly plan using the semantic content.

研究の動機と目的

  • 未学習で視覚的に多様な人間が設計した環境における深層強化学習エージェントの一般化を向上させること。
  • 計画が重視されるタスクにおけるモデルフリーRLの限界と、高次元観測空間におけるモデルベースRLの限界に対処すること。
  • 現実世界の屋内シーンにおいて共通する意味的構造(例:部屋の機能、物の配置)を活用して効果的な計画を実現すること。
  • 少数の観測で効率的に計画が可能で、軽量かつ解釈可能で、動的に更新可能な意味モデルを開発すること。
  • 意味レベルの計画が長時間スケール視覚的ナビゲーションタスクにおいて顕著に性能向上をもたらすことを実証すること。

提案手法

  • フレームワークは、第一人称視覚入力を用いて原始的行動を実行するモデルフリーなマルチターゲット部分方策を組み合わせる。
  • 環境の構造的事前知識を表現するために、低次元のバイナリ意味信号(例:部屋タイプ、物の有無)の上にベイジアン意味モデルを学習する。
  • 意味モデルは学習分布からの事前分布で初期化され、テスト中に新しい観測を用いて事後分布推論により更新される。
  • 高レベルの意思決定は、意味モデル上の計画によって部分方策の次のサブターゲットを選択することで行われる。
  • ベイズの定理を用いて意味モデルを段階的に更新することで、最小限の探索で効率的な適応が可能になる。
  • システムはハイブリッドアーキテクチャを採用しており、意味モデルが計画に、視覚方策が実行に使用され、両者に共通する意味信号が入力として供給される。

実験結果

リサーチクエスチョン

  • RQ1意味構造を用いたモデルベース計画システムは、未学習の3次元環境における一般化を向上させることができるか?
  • RQ2少数の観測で効率的に更新可能な軽量で解釈可能な意味モデル上で計画することは、エンドツーエンドのモデルフリーまたは階層的RLと比較して、長時間スケールナビゲーションにおいてどのように異なるか?
  • RQ3少数の観測で効率的に更新可能なベイジアン意味モデルは、効果的な探索を支援するためにどの程度有効か?
  • RQ4原始ピクセルではなく意味信号を用いることで、視覚的ナビゲーションにおけるサンプル効率性と性能が向上するか?
  • RQ5意味信号がニューラルネットワークを用いて抽出された場合、フレームワークの性能はどの程度保たれるか?

主な発見

  • LEAPSは、意味的補強方策やLSTMコントローラーを備えたHRLエージェントを含む強力なモデルフリーベースラインを、特に長時間スケールタスクで上回る。
  • ターゲット距離が長くなるほど、LEAPSとベースラインとの相対的改善が顕著に増加し、意味レベル計画の有効性が裏付けられる。
  • グランドトゥルースラベルではなくCNNベースの意味抽出器を用いても、LEAPSは高い性能を維持し、グランドトゥルース意味を用いた基準エージェントに非常に近い性能を達成する。
  • LEAPSの意味モデルは非常に効率的で、LSTMベースコントローラーの10,000以上のパラメータと比較してわずか38パラメータにとどまるが、優れた性能を発揮する。
  • 意味モデルの事前分布が変更されないため、最小限の微調整で新しい部分方策への適応が迅速に可能である。
  • ランダムな迷路ではフレームワークが全探索に劣化することから、本研究の成功は現実世界環境における意味的一致性に依存していることが確認される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。