Skip to main content
QUICK REVIEW

[論文レビュー] Latent World Models For Intrinsically Motivated Exploration

Aleksandr Ermolov, Nicu Sebe|arXiv (Cornell University)|Oct 5, 2020
Machine Learning and Algorithms参考文献 1被引用数 13
ひとこと要約

本稿では、時間的近接性に従って画像観測を低次元の潜在空間に配置する自己教師あり表現学習手法であるLatent World Models (LWM) を提案する。この手法により、予測モデルの誤差を用いたノイズ検出が可能となり、部分的に観測可能な、報酬が疎である環境(例:Atariゲーム)における内発的探索の性能が向上する。時間的対照学習と世界モデルを組み合わせることで、モンテズマのレインボーやその他の困難な探索ベンチマークで最先端の結果を達成した。

ABSTRACT

In this work we consider partially observable environments with sparse rewards. We present a self-supervised representation learning method for image-based observations, which arranges embeddings respecting temporal distance of observations. This representation is empirically robust to stochasticity and suitable for novelty detection from the error of a predictive forward model. We consider episodic and life-long uncertainties to guide the exploration. We propose to estimate the missing information about the environment with the world model, which operates in the learned latent space. As a motivation of the method, we analyse the exploration problem in a tabular Partially Observable Labyrinth. We demonstrate the method on image-based hard exploration environments from the Atari benchmark and report significant improvement with respect to prior work. The source code of the method and all the experiments is available at https://github.com/htdt/lwm.

研究の動機と目的

  • 報酬が疎で部分的に観測可能な環境において、ランダムな探索が非効率であるという課題に対処すること。
  • 観測間の時間的距離に従って潜在埋め込みを配置する自己教師あり表現学習手法を開発し、確率的ノイズに対する耐性を高めること。
  • 学習済み潜在空間における予測世界モデルを用いて、欠落している環境情報を推定し、予測誤差を用いて探索を誘導すること。
  • 特に報酬が疎なハードな探索を要するAtariゲームを含む画像ベース環境における本手法の有効性を示すこと。
  • 経験再生バッファを再利用して最新の世界モデル予測に基づき内発的報酬を再計算することで、サンプル効率を向上させること。

提案手法

  • 本手法は、時間的近接性に基づく対照学習目的を用いる:潜在空間内での観測の表現間のオイラー距離を最小化する。
  • 退化解の回避と一貫性・分離性の高い表現を確保するため、特徴のホワイトニングを適用する。
  • 再帰的な世界モデルを訓練し、現在の潜在状態と行動を入力として、次の潜在状態を予測する。予測誤差を内発的報酬として用いる。
  • 世界モデルは潜在空間で動作するため、画像レベルの再構成を回避し、計算効率を向上させる。
  • 内発的報酬は世界モデルの予測誤差として計算され、外発的報酬と組み合わせて探索方策を学習する。
  • サンプル効率を向上させるために経験再生を用い、各再生サンプルについて最新の世界モデル予測に基づき内発的報酬を再計算する。

実験結果

リサーチクエスチョン

  • RQ1時間的距離に従って潜在埋め込みを配置する自己教師あり表現学習手法は、画像観測における確率的ノイズに対して耐性を高めることができるか?
  • RQ2このような表現で学習された予測世界モデルは、部分的に観測可能な環境において、新しい状態や未訪問状態を効果的に検出できるか?
  • RQ3潜在空間における世界モデルの予測誤差を内発的報酬として用いることで、報酬が疎な環境における探索効率が著しく向上するか?
  • RQ4提案手法は、先行する内発的好奇心およびノイズ検出手法よりも、ハードな探索を要するAtariゲームで優れた性能を示すか?
  • RQ5本手法は、エピソード的および生涯にわたる不確実性の相互作用をどのように処理するか?

主な発見

  • LWM手法は、モンテズマのレインボーゲームで最終的な累積報酬2276を達成し、先行手法(ICM:161、RND:377)を著しく上回った。
  • フロストバイトでは累積報酬8409を記録し、次に優れた手法(4465)を3900点以上上回った。
  • ベンチャーでは998のスコアを記録し、前回の最高(707)を291点上回り、複雑な探索タスクにおける性能向上を示した。
  • 本手法は、4×4および5×5のサイズを含む、テストされたすべての部分的に観測可能なラビリンスのサイズを正常に解決した。標準的な再帰的DQNは完全に失敗した。
  • 自己教師あり表現学習手法は、確率的ノイズに対して実証的に耐性を示し、潜在空間内での観測の時間的配置が有効に実現された。
  • 再生バッファからの最新の内発的報酬を用いることで、サンプル効率が向上し、画像ベース環境における安定な学習が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。