[論文レビュー] Relative Variational Intrinsic Control
本稿では、相対的状態遷移を用いて転送性能を向上させる相対的変分内在的制御(RVIC)を提案する。RVICは、初期状態と最終状態の両方からのスキルの予測可能性を最大化するとともに、最終状態からの予測可能性を最小化することで、多様で一般化可能なスキルを学習する。RVICは、エージェントが状態空間全体にわたって一般化可能なアフォーダンスに基づくスキルを学習でき、AtariやDeepMind Control Suiteの階層的強化学習設定において、先行手法を上回る性能を発揮する。
In the absence of external rewards, agents can still learn useful behaviors by identifying and mastering a set of diverse skills within their environment. Existing skill learning methods use mutual information objectives to incentivize each skill to be diverse and distinguishable from the rest. However, if care is not taken to constrain the ways in which the skills are diverse, trivially diverse skill sets can arise. To ensure useful skill diversity, we propose a novel skill learning objective, Relative Variational Intrinsic Control (RVIC), which incentivizes learning skills that are distinguishable in how they change the agent's relationship to its environment. The resulting set of skills tiles the space of affordances available to the agent. We qualitatively analyze skill behaviors on multiple environments and show how RVIC skills are more useful than skills discovered by existing methods when used in hierarchical reinforcement learning.
研究の動機と目的
- 既存のスキル発見手法が最終状態のみに依存して状態空間を自明に分割するという限界を解消すること。
- スキルがエージェントと環境の関係をどのように変えるかという点で多様であるが、単に到達位置での違いに依存しないスキルを学習すること。
- 下流の階層的強化学習タスクに適した、より組み合わせ可能で一般化可能なスキルを可能にすること。
- スキルの多様性を終端状態のクラスタリングではなく、エージェントと環境の相互作用から生じる行動可能性(アフォーダンス)の観点から形式化すること。
- RVICで学習されたスキルが、VIC、DIAYN、VALORのものよりも階層的RLの設定においてより有用であることを実証すること。
提案手法
- RVICは二重の逆予測目的を導入する:一つは軌道の初期状態と最終状態(s₀, sₜ)からスキルを予測するもので、もう一つは最終状態sₜのみからスキルを予測するものである。
- 本手法は、スキルと(s₀, sₜ)の間の相互情報量を最大化し、同時にスキルとsₜのみの間の相互情報量を最小化する。この目的は、変分下界を用いた相互情報量の下界を用いて達成される。
- この二重の目的により、スキルが初期状態に相対的に区別可能であることが保証され、最終状態にのみ依存する自明な状態空間の分割を防ぐ。
- スキルポリシーは、二重の逆予測器を介して探索を促進し、スキルの多様性を高める強化学習の目的関数により訓練される。
- 本手法は離散的で一様にサンプリングされたスキル事前分布と、固定長のスキルエピソードを用いることで、訓練の安定化を図る。
- 本手法は、Atari や DeepMind Control Suite などのピクセルベースの環境に適用され、明示的な状態表現なしにスキル学習が可能であることが示された。
実験結果
リサーチクエスチョン
- RQ1スキル発見手法は、特定の最終状態に集中するのではなく、状態空間の異なる領域に一般化可能な多様なスキルを学習できるか?
- RQ2初期状態と最終状態に基づいたスキルの区別可能性を促進することで、階層的強化学習においてより有用なスキルが得られるか?
- RQ3最終状態のみではなく、相対的状態遷移(s₀, sₜ)に基づくスキル学習目的は、アフォーダンスに類似した行動を生み出すか?
- RQ4ピクセルベースの環境において、RVICはVIC、DIAYN、VALORと比較して、スキルの質と下流タスクの性能において優れているか?
- RQ5明示的な状態表現や連続的スキル空間に依存せずに、RVICは意味的で転送可能なスキルを学習できるか?
主な発見
- RVICは、スキルが軌道終了時の到達位置ではなく、エージェントと環境の関係をどのように変えるかに基づいて区別可能であるスキルを学習する。
- RVICが発見したスキルは、VIC、DIAYN、VALORのものよりも一般化可能で組み合わせ可能であり、初期状態と最終状態の両方に依存している。
- 階層的強化学習の設定において、RVICのスキルはAtari環境でより高いサンプル効率と優れた性能を達成する。
- RVICは、AtariおよびDeepMind Control Suiteの両環境で、生のピクセルからもアフォーダンスに類似したスキルを成功裏に学習し、視覚的観測空間への適用可能性を示した。
- 本手法は、最終状態にのみ依存する自明なスキル集合を回避し、異なる初期状態にわたって一般化するスキルを学習する。
- 実験的結果から、RVICのスキルは、特に多様な初期条件にわたるスキルの組み合わせが可能な場合に、より優れた転送性と計画性能を示すことが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。