[論文レビュー] Reinforcement Learning with Probabilistically Complete Exploration
本稿では、スパースリワード強化学習における方策初期化のための高品質なデモンストレーションを生成するために、Rapidly-exploring Random Tree (RRT)計画を用いる、Rapidly Randomly-exploring Reinforcement Learning (R3L) を提案する。強化学習の微調整の前にRRTを用いて成功する軌道を探索することで、標準的手法や内生的探索手法と比較して、収束が速く、サンプル複雑度が低く、より高いロバスト性を達成する。
Balancing exploration and exploitation remains a key challenge in reinforcement learning (RL). State-of-the-art RL algorithms suffer from high sample complexity, particularly in the sparse reward case, where they can do no better than to explore in all directions until the first positive rewards are found. To mitigate this, we propose Rapidly Randomly-exploring Reinforcement Learning (R3L). We formulate exploration as a search problem and leverage widely-used planning algorithms such as Rapidly-exploring Random Tree (RRT) to find initial solutions. These solutions are used as demonstrations to initialize a policy, then refined by a generic RL algorithm, leading to faster and more stable convergence. We provide theoretical guarantees of R3L exploration finding successful solutions, as well as bounds for its sampling complexity. We experimentally demonstrate the method outperforms classic and intrinsic exploration techniques, requiring only a fraction of exploration samples and achieving better asymptotic performance.
研究の動機と目的
- ランダム探索が非効率であるスパースリワード環境における強化学習の高いサンプル複雑度に対処すること。
- ランダム初期化への依存を軽減し、方策勾配法におけるランダムシードへのロバスト性を向上させること。
- 人間の専門知識を必要とせずに、自動的に効果的なデモンストレーションを生成する手法を開発すること。
- 強化学習における探索のための解の完全性とサンプリング複雑度に関する理論的保証を提供すること。
- TRPO や DDPG などの標準的強化学習アルゴリズムの漸近的性能と収束速度を向上させること。
提案手法
- 状態空間における計画問題として強化学習の探索を定式化し、RRTを用いて成功する軌道を探索する。
- RRTの解から得られるデモンストレーションを用いて、勾配情報が非ゼロの領域での方策パラメータを初期化する。
- TRPO や DDPG などの一般的な強化学習アルゴリズムを用いて、RRTによって生成された初期化から方策を微調整する。
- R3Lが確率的完全性を有することを理論的に保証し、サンプリング複雑度の上限を導出する。
- バイアスのない勾配推定器を用いた確率的勾配降下法を採用し、初期化の質の向上による分散低減を考慮する。
- 探索と学習を統合し、R3Lの探索ステップを合計サンプル数に含める。
実験結果
リサーチクエスチョン
- RQ1RRTを用いた計画ベース探索は、スパースリワード強化学習におけるサンプル複雑度を顕著に低減できるか?
- RQ2RRTによって生成されたデモンストレーションによる方策の初期化は、収束速度と漸近的性能を向上させるか?
- RQ3TRPO などの方策勾配法において、R3Lは異なるランダムシードに対して分散を低減できるか?
- RQ4R3Lは、悪いランダム初期化に対してもロバストであり、内生的またはランダム探索戦略よりも効果的か?
- RQ5R3Lの探索フェーズにおける完全性とサンプリング複雑度について、どのような理論的保証を提供できるか?
主な発見
- R3Lは、全テスト環境において中央値および第3四分位数性能において、ヴァナイルTRPO や DDPG、および VIME-TRPO を上回る。
- R3L-TRPO および R3L-DDPG は、ベースライン手法と比較して収束が早く、最終的な割引なしリターンが高くなる。
- R3Lの第1四分位数性能は、ベースラインと比べて顕著に高く、ランダムシードや初期化への感受性が低いことを示している。
- R3Lは、標準的手法と比較して、探索に必要なサンプル数のわずかな割合で済み、結果の図において明確に探索フェーズのオフセットが示されている。
- R3Lの事前学習は、DDPGに内在する不安定性を緩和し、性能低下後の回復を可能にする。
- R3Lは、情報量の多い勾配を持つ領域での初期化により、漸近的性能を向上させるとともに、方策勾配更新の分散を低減する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。