Skip to main content
QUICK REVIEW

[論文レビュー] Novelty Search in Representational Space for Sample Efficient Exploration

Ruo Yu Tao, Vincent François-Lavet|arXiv (Cornell University)|Sep 28, 2020
Machine Learning and Algorithms被引用数 14
ひとこと要約

本稿では、情報理論的アプローチで学習された低次元表現空間におけるノベルティサーチを活用することで、強化学習におけるサンプル効率の良い探索手法を提案する。情報ボトルネック原理を用いてモデルベースとモデルフリーの目的を統合することで、潜在空間における最近傍距離を用いて内因的報酬を生成し、スパース報酬の迷路や制御タスクにおいて、強力なベースラインと比較して顕著に探索効率が向上する。

ABSTRACT

We present a new approach for efficient exploration which leverages a low-dimensional encoding of the environment learned with a combination of model-based and model-free objectives. Our approach uses intrinsic rewards that are based on the distance of nearest neighbors in the low dimensional representational space to gauge novelty. We then leverage these intrinsic rewards for sample-efficient exploration with planning routines in representational space for hard exploration tasks with sparse rewards. One key element of our approach is the use of information theoretic principles to shape our representations in a way so that our novelty reward goes beyond pixel similarity. We test our approach on a number of maze tasks, as well as a control problem and show that our exploration approach is more sample-efficient compared to strong baselines.

研究の動機と目的

  • 報酬がスパースまたは存在しない環境における強化学習のサンプル効率の向上を目的とする。
  • 不要な視覚的ノイズを排除しながら意味のあるダイナミクスを捉える表現学習手法の開発を目的とする。
  • 潜在空間におけるノベルティに基づく内因的報酬メカニズムの設計を目的とし、効果的な探索を実現する。
  • モデル予測制御を用いて表現空間での計画を統合し、探索の改善を図る。
  • 学習された表現が、後続の探索タスクにおいて情報量が多くかつ一般化可能であることを保証する。

提案手法

  • 情報ボトルネック原理を活用して、状態空間の圧縮され、ダイナミクスに関連する表現を学習する。
  • モデルベースとモデルフリーの目的を併用して最適化することで、ダイナミックな類似性を保持する低次元の潜在表現を学習する。
  • 潜在空間におけるk番目の最近傍を用いて、以前に訪問した状態からの距離に基づいたノベルティスコアを計算する。
  • ノベルティスコアに比例する内因的報酬を生成し、新しいダイナミックな行動の探索を促進する。
  • モデルが十分に正確である場合にのみ、モデル予測制御(MPC)を用いて行動を計画することで、信頼性の高いノベルティ推定を保証する。
  • 情報理論的制約を用いて表現を整形し、潜在空間内の距離が単なるピクセルレベルの変化ではなく、意味のあるダイナミックな差を反映するようにする。

実験結果

リサーチクエスチョン

  • RQ1潜在空間におけるノベルティに基づく内因的報酬は、報酬がスパースな環境における探索のサンプル効率を向上させることができるか?
  • RQ2ピクセルベースのノベルティと比較して、情報理論的表現学習は、内因的報酬の質をどのように向上させるか?
  • RQ3状態空間への直接的な計画と比較して、表現空間での計画は、どの程度探索を改善できるか?
  • RQ4モデルベースとモデルフリーの表現学習を併用することで、探索に向けたより強固で一般化可能な表現が得られるか?
  • RQ5モンテズマのレインボーのような複雑な環境において、本手法は計算コストとパフォーマンスの面でどの程度スケーリング可能か?

主な発見

  • 提案手法は、キュリオシティやカウントベースの探索といった強力なベースラインと比較して、迷路ナビゲーションタスクにおいて優れたサンプル効率を達成した。
  • 潜在空間におけるノベルティ報酬の使用により、報酬がスパースな環境でも収束が速く、状態空間のカバー範囲がより包括的になった。
  • 情報理論的表現学習により、不要な視覚的ノイズが効果的にフィルタリングされ、意味のあるダイナミックな変化に焦点を当てた探索が可能になった。
  • 信頼性の高いモデルを用いたMPCの統合により、モデルが正確である場合にのみ計画が実行され、安定性とパフォーマンスが向上した。
  • モンテズマのレインボーにおける予備的な結果は前向きであり、複雑なダイナミクスを有するより広範な環境へのスケーリングの可能性を示唆している。
  • 意味のある潜在表現により、エージェント行動の解釈可能性が向上し、人間が関与するアプリケーションにおいて利便性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。