[論文レビュー] Efficient Hierarchical Exploration with Stable Subgoal Representation Learning.
本稿では、well-exploredな領域における埋め込みの安定化を図りながら未到達領域での更新を可能にする状態固有の正則化を用いる、階層強化学習における安定なサブゴール表現学習手法を提案する。安定な表現を活用することで、新規性とポテンシャルに基づくサブゴール選択を導入し、SOTAベースラインと比較して、スパarsely-rewardedな連続的制御タスクにおける探索効率と性能が顕著に向上する。
Goal-conditioned hierarchical reinforcement learning (HRL) serves as a successful approach to solving complex and temporally extended tasks. Recently, its success has been extended to more general settings by concurrently learning hierarchical policies and subgoal representations. However, online subgoal representation learning exacerbates the non-stationary issue of HRL and introduces challenges for exploration in high-level policy learning. In this paper, we propose a state-specific regularization that stabilizes subgoal embeddings in well-explored areas while allowing representation updates in less explored state regions. Benefiting from this stable representation, we design measures of novelty and potential for subgoals, and develop an efficient hierarchical exploration strategy that actively seeks out new promising subgoals and states. Experimental results show that our method significantly outperforms state-of-the-art baselines in continuous control tasks with sparse rewards and further demonstrate the stability and efficiency of the subgoal representation learning of this work, which promotes superior policy learning.
研究の動機と目的
- 階層強化学習におけるオンラインサブゴール表現学習における非定常性と探索の課題に対処すること。
- 頻繁に訪問される状態領域におけるサブゴール埋め込みの安定化と、未到達領域における動的更新の両立を図ること。
- 表現の安定性を活用して、新たな有望なサブゴールを能動的に同定する効率的な階層的探索戦略の開発。
- スパarsely-rewardedな複雑で時間的に長いタスクにおけるポリシー学習性能の向上。
提案手法
- 状態訪問頻度に基づいてサブゴール表現の更新を制約する状態固有の正則化技術を導入する。
- 正則化されたサブゴール表現を用いてサブゴールの新規性とポテンシャルを計算し、未到達でありながら有望な領域への探索を誘導する。
- ハイレベルポリシーが新規性とポテンシャルに基づいてサブゴールを選択し、ローレベルポリシーがそれらに到達するための行動を実行する階層的RLフレームワークを採用する。
- 頻繁に訪問される状態において安定した表現を維持することで、分布シフトの低減と学習安定性の向上を図る。
- サブゴール表現の安定性を活用して、サブゴール選択のための意味のある内因的報酬を定義する。
- 高いポテンシャルと高い新規性を持つサブゴールを優先する、新しい探索戦略を設計し、状態空間のより効率的なカバレッジを促進する。
実験結果
リサーチクエスチョン
- RQ1階層強化学習におけるオンライン学習において、どのようにサブゴール表現学習を安定化させることができるか?
- RQ2表現の安定性は、高次元でスパarsely-rewardedな環境における探索効率向上にどのような役割を果たすか?
- RQ3安定なサブゴール表現に基づく新規性とポテンシャルの指標は、階層的探索を効果的に導けるか?
- RQ4提案手法は、複雑な制御タスクにおけるサンプル効率と最終的性能の面で、SOTA手法と比較してどのように差をつけるか?
主な発見
- 提案手法は、スパarsely-rewardedな連続的制御タスクにおいて、SOTAベースラインと比較して顕著な性能向上を達成した。
- 安定なサブゴール表現学習は、オンライン学習中の分布シフトを低減し、学習安定性を向上させた。
- 新規性とポテンシャルに基づくサブゴール選択戦略により、より効率的な探索が可能となり、状態空間のより大きな領域がカバーされた。
- 本手法は優れたサンプル効率を示し、より少ない環境相互作用回数で高い報酬を達成した。
- アブレーションスタディの結果、状態固有の正則化が安定な表現を維持し、最終的なポリシー性能を向上させるために不可欠であることが確認された。
- 実験的結果から、安定な表現はより信頼性が高く効果的なサブゴール発見を可能にし、全体のポリシー学習を強化することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。