Skip to main content
QUICK REVIEW

[論文レビュー] World Discovery Models

Mohammad Gheshlaghi Azar, Bilal Piot|arXiv (Cornell University)|Feb 20, 2019
Neural Networks and Applications参考文献 55被引用数 12
ひとこと要約

本論文では、微分情報利得を最適化することで、部分的に観測可能で確率的な環境において世界を自己教師付きで発見する強化学習エージェントであるNDIGOを紹介する。新しい観測が将来の予測精度をどの程度向上させるかを測ることで、NDIGOは、ノイズが多い状況でも、従来の好奇心ベースの手法を上回る性能を発揮し、意味のある世界構造を発見する。特に、ランダムなパターンに惑わされず、隠れた物体を効果的に発見できる。

ABSTRACT

As humans we are driven by a strong desire for seeking novelty in our world. Also upon observing a novel pattern we are capable of refining our understanding of the world based on the new information---humans can discover their world. The outstanding ability of the human mind for discovery has led to many breakthroughs in science, art and technology. Here we investigate the possibility of building an agent capable of discovering its world using the modern AI technology. In particular we introduce NDIGO, Neural Differential Information Gain Optimisation, a self-supervised discovery model that aims at seeking new information to construct a global view of its world from partial and noisy observations. Our experiments on some controlled 2-D navigation tasks show that NDIGO outperforms state-of-the-art information-seeking methods in terms of the quality of the learned representation. The improvement in performance is particularly significant in the presence of white or structured noise where other information-seeking methods follow the noise instead of discovering their world.

研究の動機と目的

  • 外在的報酬に依存せずに、部分的に観測可能で確率的な環境において世界を発見できる自己教師付きエージェントの開発。
  • 既存の好奇心ベースのエージェントが、意味のある世界構造ではなく、ノイズやランダムなパターンに引きつけられがちなという限界の解消。
  • タスクの達成成功ではなく、オブジェクト位置予測のガラスボックス評価を用いて、内部世界表現の質に基づいて発見性能を評価すること。
  • 未観測領域への探索を促進し、発見情報の長期的記憶統合を可能にする、ロバストな内部報酬メカニズムの設計。

提案手法

  • NDIGOは、現在の観測を含むモデルと含まないモデルの予測誤差の差分として内部報酬を計算し、新しい情報が将来の予測をどの程度改善するかを測定する。
  • 過去の観測系列に基づいて将来の観測を予測するニューラルネットワークを用い、最新の観測を含めることによる予測誤差の低下が報酬となる。
  • この内部報酬を用いて、最先端の強化学習アルゴリズム(例:IMPALA)によりポリシーを学習させ、エージェントが新しい世界構造を探索・発見できるようにする。
  • 予測誤差の差分をとることで、改善不可能な誤差が相殺されるため、ノイズに強く、ランダムまたは構造的なノイズに引きつけられない。
  • 内部状態から固定および可動オブジェクトの位置をどれだけ正確に予測できるかを測定することで、世界表現をガラスボックス法で評価する。

実験結果

リサーチクエスチョン

  • RQ1外在的報酬が存在しない部分的に観測可能な2次元環境において、エージェントは隠れたオブジェクトを発見できるか?
  • RQ2NDIGOで提案された情報利得メカニズムは、ノイズが多い環境や構造的なノイズがある環境でも、従来の好奇心ベースの手法を上回る性能を示すか?
  • RQ3エージェントは、新しい観測を統合しながら、忘却せずに時間経過とともに一貫性のあるグローバルな世界モデルを維持・更新できるか?
  • RQ4微分予測誤差に基づく内部報酬は、情報利得の高い未観測領域への探索を効果的に誘導できるか?

主な発見

  • 白色ノイズや構造的ノイズのある環境では、NDIGO-4は引きつけるブラウン運動を効果的に無視し、固定オブジェクトを発見したが、ICMや他のNDIGOバージョンはノイズに引きつけられた。
  • 外在的報酬のない複雑な迷路では、NDIGO-1とNDIGO-2が最も多くの部屋を探索し、最終的な固定オブジェクトを発見したが、他のエージェントはノイズオブジェクトの手前で進展しなかった。
  • NDIGO-1はすべての部屋で最小の発見誤差を達成しており、世界表現の質が優れていることを示し、迷路を探索した後、部屋2の最後の青色固定オブジェクトを唯一発見した。
  • エージェントの内部表現は、オブジェクト位置を正確に予測できており、トップダウンビューのスナップショットや予測された世界ビューから、一貫性のあるグローバルモデルが構築されていることが確認された。
  • ガラスボックス評価により、NDIGOの内部状態がオブジェクト位置を高い精度で予測できることを確認し、効果的な世界モデル学習が実現していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。