[論文レビュー] Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation
本稿では、グラフニューラルネットワークアンサンブルを用いた構造的ワールドモデルを活用することで、多対象操作におけるサンプル効率的で好奇心駆動型の探索を実現するCEE-USという手法を提案する。モデルの不一致を用いてエピステミック的不確実性の低減を計画することで、エージェントは相互作用を豊富に含む行動を示し、訓練なしに未学習のタスク(積み上げ、ひっくり返し、投げることなど)にゼロショットで一般化することができる。
It has been a long-standing dream to design artificial agents that explore their environment efficiently via intrinsic motivation, similar to how children perform curious free play. Despite recent advances in intrinsically motivated reinforcement learning (RL), sample-efficient exploration in object manipulation scenarios remains a significant challenge as most of the relevant information lies in the sparse agent-object and object-object interactions. In this paper, we propose to use structured world models to incorporate relational inductive biases in the control loop to achieve sample-efficient and interaction-rich exploration in compositional multi-object environments. By planning for future novelty inside structured world models, our method generates free-play behavior that starts to interact with objects early on and develops more complex behavior over time. Instead of using models only to compute intrinsic rewards, as commonly done, our method showcases that the self-reinforcing cycle between good models and good exploration also opens up another avenue: zero-shot generalization to downstream tasks via model-based planning. After the entirely intrinsic task-agnostic exploration phase, our method solves challenging downstream tasks such as stacking, flipping, pick & place, and throwing that generalizes to unseen numbers and arrangements of objects without any additional training.
研究の動機と目的
- 内在的好奇心を用いて、構成的多対象環境におけるサンプル効率的で相互作用を豊富に含む探索を可能にすること。
- 従来の内在的報酬手法が、スパarsな操作シナリオにおいて情報価値の高い相互作用を適切に優先できないという限界を克服すること。
- グラフニューラルネットワークによる関係的インダクティブバイアスを活用し、探索の質と下流タスクへの一般化性能を向上させること。
- タスクに依存しない内在的段階でのみ学習することで、未学習の物体数や配置にゼロショットで一般化できることを示すこと。
- モデルベース計画を用いて、モデル学習と探索の間で自己強化的なサイクルを構築すること。
提案手法
- 本手法は、物体をノードとして関係的相互作用を持つようにモデル化する、グラフニューラルネットワーク(GNN)のアンサンブルを用いる。
- GNNアンサンブルのメンバー間の不一致を用いてエピステミック的不確実性を計算し、内在的好奇心報酬を生成する。
- オンライン計画アルゴリズムが構造的ワールドモデルを用いて、将来のエピステミック的不確実性低減を最大化する行動を選択する。
- エージェントは不確実性に従って能動的探索を行い、そのデータを用いてワールドモデルを段階的に改善する。
- タスクに依存しない内在的段階を経た後、学習されたモデルを用いてモデルベース強化学習により下流タスクのゼロショット計画が可能になる。
- 本手法はプロ prioceptive状態観測のみを用い、画像観測やRNDなどの別個の内在的報酬モジュールを必要としない。
実験結果
リサーチクエスチョン
- RQ1関係的インダクティブバイアスを有する構造的ワールドモデルは、多対象操作における好奇心駆動型探索のサンプル効率を向上させ得るか?
- RQ2エピステミック的不確実性低減の計画は、標準的な内在的報酬手法と比較して、より情報価値の高い相互作用を促進する探索を実現するか?
- RQ3内在的好奇心のみで学習したモデルは、未学習の物体数を含む多様な下流操作タスクにゼロショットで一般化可能か?
- RQ4GNNアンサンブルの不一致による不確実性ベース探索は、RND や ICM などの代替内在的報酬メカニズムと比較してどのように異なるか?
- RQ5モデルベース計画は、内在的探索段階を経た後、どの程度下流タスクのパフォーマンスを向上させるか?
主な発見
- CEE-USは、RND や ICM を用いたベースラインと比較して、ピックアンドプレース、スタッキング、フラッピング、スローブなどの下流タスクで顕著に高い成功確率を達成している。
- 4つの物体を用いたピックアンドプレースタスクにおいて、CEE-USはRNDベースの対応手法よりも高速に高いパフォーマンスに到達しており、優れたサンプル効率を示している。
- RoboDesk環境において、ドアを開けるタスクで0.97 ± 0.02、スライディングキャビネットを開けるタスクで0.87 ± 0.07の成功確率を達成しており、強力なゼロショット一般化を示している。
- 空気中に物体を多く保持するデータを収集しているにもかかわらず、GNN + RNDの変種はCEE-USに劣り、不確実性ベース探索がより有用なデータ収集を実現していることが示唆されている。
- CEE-USは、MLP + iCEM や他のベースラインと比較して、相互作用の豊かさと下流タスクパフォーマンスの両面で優れている。特に、複雑な物体操作を要するタスクで顕著な優位性を示している。
- モデル学習と探索の間の自己強化的サイクルにより、エージェントは外在的報酬信号なしに、フラッピングやスタッキングといった複雑な行動を発展させることができた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。