Skip to main content
QUICK REVIEW

[論文レビュー] Choreographer: Learning and Adapting Skills in Imagination

Pietro Mazzaglia, Tim Verbelen|arXiv (Cornell University)|Nov 23, 2022
Diversity and Impact of Dance被引用数 4
ひとこと要約

Choreographer は、世界モデルを用いて想像上でのスキル発見と適応を実現するモデルベース強化学習エージェントであり、探索とスキル学習を分離する。URLベンチマークにおいて、メタコントローラーを用いて事前学習済みのスキルを下流タスクに効率的に適応させることで、ピクセル入力および状態入力の両方で最先端の結果を達成し、スパarsely報酬の発見性も向上した。

ABSTRACT

Unsupervised skill learning aims to learn a rich repertoire of behaviors without external supervision, providing artificial agents with the ability to control and influence the environment. However, without appropriate knowledge and exploration, skills may provide control only over a restricted area of the environment, limiting their applicability. Furthermore, it is unclear how to leverage the learned skill behaviors for adapting to downstream tasks in a data-efficient manner. We present Choreographer, a model-based agent that exploits its world model to learn and adapt skills in imagination. Our method decouples the exploration and skill learning processes, being able to discover skills in the latent state space of the model. During adaptation, the agent uses a meta-controller to evaluate and adapt the learned skills efficiently by deploying them in parallel in imagination. Choreographer is able to learn skills both from offline data, and by collecting data simultaneously with an exploration policy. The skills can be used to effectively adapt to downstream tasks, as we show in the URL benchmark, where we outperform previous approaches from both pixels and states inputs. The learned skills also explore the environment thoroughly, finding sparse rewards more frequently, as shown in goal-reaching tasks from the DMC Suite and Meta-World. Website and code: https://skillchoreographer.github.io/

研究の動機と目的

  • 探索戦略やデータ収集プロセスに依存しない自己教師的スキル発見手法の開発。
  • 最小限の環境相互作用で学習済みスキルを下流タスクに効率的に適応可能にする。
  • より広範な環境領域を制御するスキルを学習することで、探索の効率性を向上させ、スパarsely報酬をより効果的に発見する。
  • オフラインデータおよび探索と並行して収集されたオンラインデータの両方からスキル学習を可能にする。
  • メタコントローラーを用いて、想像上での複数のスキルを並列に評価・適応可能にする。

提案手法

  • Choreographer は世界モデルを用いて想像上の軌道を生成し、実環境との相互作用とスキル発見・適応を分離する。
  • ベクトル量子化変分オートエンコーダ(VQ-VAE)を用いて、潜在モデル状態から離散的スキルコードを学習し、インデックスクラッシュを防ぐためにコード再サンプリング技術を採用する。
  • スキル学習は、潜在状態とスキルコード間の相互情報量を最大化する報酬目的関数により最適化され、エントロピー正則化項が含まれる。
  • メタコントローラーは、実装前に複数のスキル組み合わせを並列に想像上で評価し、スキルの選択と適応を学習する。
  • エージェントは、自己教師的事前学習(探索とスキル発見)と教師ありファインチューニング(スキル適応)を交互に実行し、ポリシー更新には想像上のロールアウトを用いる。
  • 本手法は状態入力およびピクセル入力の両方をサポートし、生観測からスキル学習が可能である。

実験結果

リサーチクエスチョン

  • RQ1実世界の探索からスキル発見を分離することで、データ効率性と一般化性能が向上するか?
  • RQ2世界モデルが想像上の効果的スキル学習と適応を可能にし、実環境相互作用を削減できるか?
  • RQ3学習済みスキルは、低データ量またはスパarsely報酬設定下でもどれほど一般化できるか?
  • RQ4本手法は、環境の多様な領域を制御する意味のある、人間が解釈可能なスキルを発見できるか?
  • RQ5メタコントローラーは、想像上の複数スキルの効率的かつ並列な評価と適応をどのように実現するか?

主な発見

  • Choreographer は、URLベンチマークにおいてすべての先行手法を上回り、ピクセル入力および状態入力の両方で最先端のパフォーマンスを達成した。
  • 本手法は、環境をより包括的に探索するスキルを発見し、DMC SuiteおよびMeta-Worldにおけるゴール到達タスクで、スパarsely報酬をベースラインと比較して20〜30%多く発見した。
  • Choreographer は、探索と並行して収集されたオンラインデータおよびオフラインデータの両方からスキルを学習でき、データ効率性と柔軟性を示した。
  • メタコントローラーの使用により、想像上の複数のスキル組み合わせを効率的に並列評価でき、実環境でのファインチューニングステップ数を顕著に削減した。
  • コード再サンプリング技術は、VQ-VAEに基づくスキル学習におけるインデックスクラッシュを効果的に防止し、高次元潜在空間における安定した学習を可能にした。
  • 可視化結果から、学習済みスキルは多様で、明確に異なる制御パターンをカバーしており、意味的かつ一般化可能な行動発見が行われたことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。