Skip to main content
QUICK REVIEW

[論文レビュー] Active Hierarchical Exploration with Stable Subgoal Representation Learning

Siyuan Li, Jin Zhang|arXiv (Cornell University)|May 31, 2021
Mobile Crowdsensing and Crowdsourcing被引用数 7
ひとこと要約

本論文では、状態に依存する正則化を用いて部分目標表現学習を安定化させる、新しいアクティブな階層的探索手法HESSを提案する。これにより、長時間スパンで報酬が疎である連続制御タスクにおいて、効率的で安定したハイレベルポリシー学習が可能になる。内因的報酬に依存せずに、正則化された新奇性測度と到達可能性に基づくポテンシャル関数を組み合わせることで、有望な部分目標を能動的に選択し、困難な疎報酬ベンチマークで最先端のサンプル効率とパフォーマンスを達成する。

ABSTRACT

Goal-conditioned hierarchical reinforcement learning (GCHRL) provides a promising approach to solving long-horizon tasks. Recently, its success has been extended to more general settings by concurrently learning hierarchical policies and subgoal representations. Although GCHRL possesses superior exploration ability by decomposing tasks via subgoals, existing GCHRL methods struggle in temporally extended tasks with sparse external rewards, since the high-level policy learning relies on external rewards. As the high-level policy selects subgoals in an online learned representation space, the dynamic change of the subgoal space severely hinders effective high-level exploration. In this paper, we propose a novel regularization that contributes to both stable and efficient subgoal representation learning. Building upon the stable representation, we design measures of novelty and potential for subgoals, and develop an active hierarchical exploration strategy that seeks out new promising subgoals and states without intrinsic rewards. Experimental results show that our approach significantly outperforms state-of-the-art baselines in continuous control tasks with sparse rewards.

研究の動機と目的

  • 長時間スパンで報酬が疎なタスクにおいて、効果的なハイレベル探索を妨げる、ゴール条件付き階層的強化学習(GCHRL)におけるオンライン学習された部分目標表現の不安定性を解消すること。
  • 信頼性の高い新奇性およびポテンシャル推定を支援する、安定した部分目標表現空間を設計することで、探索効率を向上させること。
  • 内因的報酬に依存せずに、高いポテンシャルと新奇性を持つ部分目標を能動的に選択する探索戦略を開発し、直接的で効率的なポリシー学習を可能にすること。
  • 疎な外部報酬を伴う挑戦的な連続制御環境において、優れたサンプル効率とパフォーマンスを達成すること。

提案手法

  • 既に表現目的を満たしている埋め込みへの更新を制約することで、部分目標表現の学習安定性と効率性を向上させる、状態に依存する正則化を導入する。
  • 先行研究にインspiredされたコントラスト型目的関数を用い、潜在空間における意味的で分離可能な部分目標埋め込みを学習する。
  • 部分目標空間における訪問回数に基づく正則化された新奇性測度を設計し、隣接領域の到達可能性を評価するポテンシャル関数を組み合わせることで、探索的である部分目標を優先する。
  • 優先順位付きサンプリング(Hinton, 2007)を用い、損失が高いサンプルに注目することで、安定性を損なわず表現学習の効率を向上させる。
  • 内因的報酬の最大化を回避するため、新奇性とポテンシャルの組み合わせに基づいて部分目標を直接選択する能動的探索戦略を設計する。
  • 正則化された新奇性とポテンシャルスコアを用いて、ハイレベルポリシーが潜在空間で部分目標を選択することで、未訪問かつ到達可能な領域への的を射ねた探索を可能にする。

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習におけるオンライン学習された部分目標表現の安定性を向上させる正則化機構は、探索の安定性を向上させ得るか?
  • RQ2動的に変化する部分目標空間において、新奇性とポテンシャルを効果的に測定する方法は何か?これによりハイレベル探索をどのようにガイドできるか?
  • RQ3正則化された新奇性とポテンシャルに基づく能動的サブゴール選択は、内因的報酬に依存する反応的探索を上回る性能を発揮するか?
  • RQ4提案手法は、長時間スパンの連続制御タスクにおいて、どの程度サンプル効率とパフォーマンスを向上させるか?

主な発見

  • HESSは、疎報酬を伴う連続制御タスクにおいて、最先端のベースラインを著しく上回り、優れたサンプル効率と最終的なパフォーマンスを示している。
  • アブレーションスタディの結果、ポテンシャル測定が極めて重要であることが確認された:ポテンシャルがなければ、部分目標は低効用領域(例:コーナー)に集中し、成功確率が著しく低下する。
  • 本手法はハイパーパrameterに対して頑健であり、スケーリング係数α、拡張距離de、安定比k%の広い範囲において安定した性能を示しており、一般化性と信頼性を示している。
  • 提案された安定性正則化は、表現学習の効率を向上させる一方で、安定性を損なわず、効果的な優先順位付きサンプリングを可能にする。
  • 反応的探索手法に比べ、内因的報酬学習の遅延を回避する能動的探索戦略が、より優れたパフォーマンスを達成している。
  • 本手法は、Ant Maze や Ant Push(画像)を含む多様なタスクにおいて、同一のハイパーパrameterセットで強力な結果を達成しており、一般化性と頑健性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。