[論文レビュー] Discovering and Achieving Goals via World Models
LEXA は、学習された世界モデルを用いて想像の中で分離された explorer ポリシーと achiever ポリシーを学習する教師なし強化学習エージェントである。novel で高情報量の状態を計画することで、教師なしで多様な目標を発見し、ゴール画像からの zero-shot でそれらを達成する。操作および走破環境における包括的で複雑なマルチオブジェクトタスクを含む新しい 40 タスクのベンチマークにおいて、先行手法を上回る性能を発揮する。
How can artificial agents learn to solve many diverse tasks in complex visual environments in the absence of any supervision? We decompose this question into two problems: discovering new goals and learning to reliably achieve them. We introduce Latent Explorer Achiever (LEXA), a unified solution to these that learns a world model from image inputs and uses it to train an explorer and an achiever policy from imagined rollouts. Unlike prior methods that explore by reaching previously visited states, the explorer plans to discover unseen surprising states through foresight, which are then used as diverse targets for the achiever to practice. After the unsupervised phase, LEXA solves tasks specified as goal images zero-shot without any additional learning. LEXA substantially outperforms previous approaches to unsupervised goal-reaching, both on prior benchmarks and on a new challenging benchmark with a total of 40 test tasks spanning across four standard robotic manipulation and locomotion domains. LEXA further achieves goals that require interacting with multiple objects in sequence. Finally, to demonstrate the scalability and generality of LEXA, we train a single general agent across four distinct environments. Code and videos at https://orybkin.github.io/lexa/
研究の動機と目的
- 人工エージェントが人間の監視なしに複雑な視覚的環境で多様なスキルを学習できるようにすること。
- 教師なしゴール条件付き強化学習における効率的探索の課題に取り組むこと。
- 教師なし事前学習後、ユーザー指定のゴール画像に対して zero-shot 一般化を可能にすること。
- 生の視覚入力からの複雑な操作および走破行動の学習にスケーラブルなフレームワークを開発すること。
- 40 の多様なタスクを含む新しいベンチマークを導入し、教師なしゴール到達エージェントの評価を可能にすること。
提案手法
- LEXA は変分自己符号化器とダイナミクスモデルを用いて、生の画像観測から世界モデルを学習する。
- エクスプローラーポリシーは世界モデル上で想像の中で計画し、期待される情報量の増加を最大化することで、新規で高情報量の状態を発見する。
- 発見された状態は、世界モデル内でのオンポリシーのロールアウトを用いて、多様なターゲットとしてアチieves ポリシーの訓練に使用される。
- アチieves ポリシーはフォアサイトに基づくロールアウトを用いて訓練され、経験の再ラベル付けを回避し、想像された軌道を活用する。
- 学習された距離関数は、状態とゴール間の到達可能性コストを測定し、オンポリシー経験を用いて想像の中で最適化される。
- このフレームワークにより、追加の学習や報酬形状の調整なしに、テスト時にゴール画像のみを用いて zero-shot ゴール到達が可能になる。
実験結果
リサーチクエスチョン
- RQ1報酬や監視なしに、複雑な視覚的環境で意味のある未確認の目標をエージェントが発見できるか?
- RQ2学習された世界モデル上でフォアサイトベースの計画が、先行手法と比較して探索効率を著しく向上させられるか?
- RQ31 つの事前学習済みアチieves ポリシーが、トレーニング時に見なかったユーザー指定のゴール画像に対して、追加の微調整なしに zero-shot で一般化できるか?
- RQ4教師なし世界モデルベースの訓練が、複雑なマルチオブジェクト操作および走破タスクで成功を収められるか?
- RQ5LEXA の性能は、挑戦的で多様なベンチマークにおいて、先行する教師なしゴール到達手法と比較してどうなるか?
主な発見
- LEXA は、先行する教師なしゴール到達ベンチマークで最先端の性能を達成し、前例のない手法を著しく上回る。
- LEXA は、複雑なマルチオブジェクト操作ベンチマークである RoboKitchen 環境のタスクを、初めて成功に導いた。
- LEXA は、4 つのロボット操作および走破ドメインにまたがる 40 の多様なテストタスクにおいて成功を収め、複数のオブジェクトとの順序的な相互作用を含む。
- 想像に基づく探索の使用は、リプレイバッファの状態や生成モデルに依存する従来手法と比較して、より多様で効果的な目標発見をもたらす。
- アチieves ポリシーは、トレーニング時に見なかったゴール画像に対して、報酬形状の調整や微調整なしに zero-shot で一般化する。
- LEXA の性能は、高次元制御タスクにおいても安定しており、RoboYoga における正確な制御や RoboBins におけるマルチオブジェクト操作の両方で成功を収める。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。