[論文レビュー] Disentangled Skill Embeddings for Reinforcement Learning
本稿では、動的要因と目的のための分離された潜在埋め込みを学習する variational inference ベースのフレームワーク、Disentangled Skill Embeddings (DSE) を提案する。この手法により、未観測の組み合わせに対しても高速な一般化が可能となる。DSE は、MuJoCo タスク(例:Reacher や CartPole)における階層的強化学習設定で、単一埋め込みおよび独立ベースラインを上回る転移性能と再訓練性能を達成する。
We propose a novel framework for multi-task reinforcement learning (MTRL). Using a variational inference formulation, we learn policies that generalize across both changing dynamics and goals. The resulting policies are parametrized by shared parameters that allow for transfer between different dynamics and goal conditions, and by task-specific latent-space embeddings that allow for specialization to particular tasks. We show how the latent-spaces enable generalization to unseen dynamics and goals conditions. Additionally, policies equipped with such embeddings serve as a space of skills (or options) for hierarchical reinforcement learning. Since we can change task dynamics and goals independently, we name our framework Disentangled Skill Embeddings (DSE).
研究の動機と目的
- マルチタスク強化学習における変化するタスクの動的要因と報酬関数にわたる方策の一般化という課題に取り組む。
- 従来の手法が抱える潜在空間の混同(entangled)問題による、未観測のタスク組み合わせへの一般化の制限を克服する。
- 動的要因と目的のための分離された、タスク固有の潜在埋め込みを学習することで、効率的な転移と高速な再訓練を実現する。
- 高レベル方策学習のための再利用可能で分離されたスキル空間を提供することで、階層的強化学習を促進する。
- ゼロショットおよび少数ショット再訓練のシナリオを通じて、未観測の動的要因と目的条件への一般化を実証する。
提案手法
- 共有方策パラメータと、2つの分離された潜在変数(動的要因 z と目的 g)を用いた variational inference 問題としてマルチタスク強化学習を定式化する。
- 方策を qϕ(π|z,g) でパラメータライズし、z と g はタスク固有の分布から独立にサンプリングする。
- 期待報酬を最大化するとともに、事後分布と事前分布の KL 発散を最小化する variational 目的関数を用いて学習する。
- 2つのアルゴリズムを実装する:DSE-REINFORCE(オンポリシー学習用)および DSE-SAC(オフポリシー、ソフトアクタクリティック風の学習用)。
- 潜在空間を分離することで、動的要因や目的条件の変更を独立に制御可能とし、補間およびゼロショット一般化を可能にする。
- 高レベル方策のための離散的アクション空間として目的埋め込み空間を用い、DSE 方策を低レベルオプションとして使用することで、階層的強化学習を実現する。
実験結果
リサーチクエスチョン
- RQ1動的要因と目的のための分離された潜在表現は、マルチタスク強化学習における一般化を向上させるか?
- RQ2高速な再訓練後に、分離された埋め込みを有する方策は、未観測の動的要因と目的の組み合わせにどの程度一般化できるか?
- RQ3分離されたスキル空間は、階層的強化学習におけるサンプル効率をどの程度向上させるか?
- RQ4分離された構造は、エンタングルドまたは単一埋め込みベースラインを上回るか、マルチタスクおよび少数ショット設定で有効か?
- RQ5学習された埋め込みは、未観測の目的軌道を含む階層的強化学習シナリオで、効果的な高レベル方策学習を支援できるか?
主な発見
- DSE-SAC は Reacher-v2 環境における未学習のテストタスクで平均エピソード報酬 -21.96 ± 2.20 を達成し、単一埋め込み SAC(-24.29 ± 1.50)を上回った。
- 単一タスク方策は DSE-SAC の初期性能に達するまでに 43.22 ± 2.16 個の軌道を必要とし、より迅速な適応が示された。
- DSE-SAC は、CartPole および Reacher の両方で補間実験を通じて、未観測の動的要因と目的の組み合わせに効果的に一般化した。
- 階層的強化学習では、DSE-SAC を低レベル方策として用いた H-SAC が、低レベルアクションで学習した標準的な SAC よりも、連続的目標追従タスクをより速く解消した。
- DSE-REINFORCE は CartPole で優れた性能を示し、DSE-SAC は Reacher で DSE-REINFORCE を上回った。これは、複雑な環境におけるより優れたサンプル効率を示している。
- 分離された構造により、動的要因と目的条件を独立に制御可能となり、効果的な補間およびゼロショット方策転送が可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。