Skip to main content
QUICK REVIEW

[論文レビュー] Emergence of Structured Behaviors from Curiosity-Based Intrinsic Motivation

Nick Haber, Damian Mrowca|arXiv (Cornell University)|Feb 21, 2018
Psychological and Educational Research Studies被引用数 11
ひとこと要約

本論文は、物理的に根拠を持つシミュレーテッド環境において、エージェントが行動の結果を予測するためのワールドモデルと、新奇で驚きの多い相互作用を求める敵対的ポリシーを学習する、好奇心駆動型強化学習フレームワークを提案する。このシステムは、事前定義された報酬や事前学習を一切用いずに、視覚的・運動的行動としての自己移動予測、物体への注意、物体収集といった構造的行動を自律的に生成し、内的動機付けを通じて自己-supervisedに発達的マイルストーンが出現することを示している。

ABSTRACT

Infants are experts at playing, with an amazing ability to generate novel structured behaviors in unstructured environments that lack clear extrinsic reward signals. We seek to replicate some of these abilities with a neural network that implements curiosity-driven intrinsic motivation. Using a simple but ecologically naturalistic simulated environment in which the agent can move and interact with objects it sees, the agent learns a world model predicting the dynamic consequences of its actions. Simultaneously, the agent learns to take actions that adversarially challenge the developing world model, pushing the agent to explore novel and informative interactions with its environment. We demonstrate that this policy leads to the self-supervised emergence of a spectrum of complex behaviors, including ego motion prediction, object attention, and object gathering. Moreover, the world model that the agent learns supports improved performance on object dynamics prediction and localization tasks. Our results are a proof-of-principle that computational models of intrinsic motivation might account for key features of developmental visuomotor learning in infants.

研究の動機と目的

  • 好奇心に基づく内的動機付けが、人工エージェントにおいて自己-supervisedに構造的で発達的類似行動を促すかどうかを調査すること。
  • 乳児が事前定義された報酬や内蔵のワールドモデルに依存せずに、内的探索を通じて視覚的・運動的スキルを学ぶメカニズムをモデル化すること。
  • ワールドモデルの正確さと探索ポリシーが敵対的相互作用を通じて共進化する計算フレームワークを構築すること。
  • 内的動機付けが、物体の運動予測や局在化といった後続タスクにおけるワールドモデル性能の向上に寄与することを示すこと。
  • 自律的エージェントが好奇心を通じて自己組織的学習を遂げ、乳児の遊びや認知発達を模倣するプロトタイプの証明を行うこと。

提案手法

  • エージェントは、シミュレーテッド3次元環境における自らの行動の視覚的結果を予測するためのワールドモデル(ニューラルネットワーク)を用いる。
  • 別個の損失モデルが、数ステップ先のワールドモデルの予測誤差を推定し、驚きや新奇性を最大化する行動を特定する。
  • エージェントのポリシーは、ワールドモデルに敵対的に挑戦する行動を選択するように訓練され、予期しない状態の探索を促進する。
  • システムはImageNetやその他の大規模分類データセットにおける事前学習を一切用いず、自己-supervisedな相互作用に依存する。
  • ワールドモデルは、現在の観測と行動から将来の観測を予測するように訓練され、自己移動や物体の運動を予測可能にする。
  • 損失モデルは、予測誤差が大きい行動を選択することで探索を駆動し、ワールドモデルの予測誤差が高くなることで、行動的・表現的レパートリーが継続的に拡大するフィードバックループを形成する。

実験結果

リサーチクエスチョン

  • RQ1内的好奇心が、自己移動予測や収集といった構造的で複雑な行動の出現を、シミュレーテッドエージェントにおいて単独で駆動できるか。
  • RQ2好奇心に基づく探索を通じて訓練されたワールドモデルが、物体の運動予測や局在化といった後続タスクのパフォーマンスをどの程度向上できるか。
  • RQ3ワールドモデルと敵対的損失モデルの相互作用が、明示的な報酬なしに自己-supervisedな発達的マイルストーンをどのように生み出すか。
  • RQ4物理的に根拠を持つ環境における好奇心ベースの学習が、自己移動予測や物体恒常性行動の自発的出現をもたらすか。
  • RQ5大規模データセット(例:ImageNet)における事前学習の欠如が、人工エージェントにおけるより自然的で発達的類似の学習を妨げるか、あるいは促進するか。

主な発見

  • エージェントは内的探索を通じて、自己移動に起因する視覚フィールドの変化を予測する能力を自発的に発達させる。
  • 明示的な物体検出や認識モジュールが存在しない状況下でも、エージェントは物体に選択的に注意を向け、局在化する能力を学習する。
  • 複数の物体が存在する状況では、エージェントはそれらを相互作用可能な範囲に集める行動を学習し、明示的な報酬設計なしに目的指向的行動を示す。
  • 好奇心に基づく探索を通じて訓練されたワールドモデルは、内在的な学習目的に含まれない後続タスク(物体の運動予測や局在化)においてもパフォーマンスが向上する。
  • ImageNetやその他の大規模ビジョンデータセットにおける事前学習が一切不要であるため、相互作用を通じた自己-supervisedな視覚表現学習の実現可能性が裏付けられる。
  • エージェントは、ワールドモデルの向上に伴い、新たな行動が出現する段階的発達的マイルストーンを経る自己カリキュラリゼーションの一種を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。