[論文レビュー] Sample-Efficient Automated Deep Reinforcement Learning
本稿では、共有された経験リプレイを用いて、オフポリシー強化学習におけるハイパーパramータとニューラルアーキテクチャを共同で最適化する、サンプル効率的な自動強化学習(SEARL)を提案する。複数のエージェントを並列に訓練しながら動的ハイパーパramータ適応とアーキテクチャ進化を可能にすることで、ランダムサーチやPBTと比較して環境との相互作用を最大10倍削減し、優れたもしくは同等の性能を達成するとともに、顕著なサンプル効率の向上を実現する。
Despite significant progress in challenging problems across various domains, applying state-of-the-art deep reinforcement learning (RL) algorithms remains challenging due to their sensitivity to the choice of hyperparameters. This sensitivity can partly be attributed to the non-stationarity of the RL problem, potentially requiring different hyperparameter settings at various stages of the learning process. Additionally, in the RL setting, hyperparameter optimization (HPO) requires a large number of environment interactions, hindering the transfer of the successes in RL to real-world applications. In this work, we tackle the issues of sample-efficient and dynamic HPO in RL. We propose a population-based automated RL (AutoRL) framework to meta-optimize arbitrary off-policy RL algorithms. In this framework, we optimize the hyperparameters and also the neural architecture while simultaneously training the agent. By sharing the collected experience across the population, we substantially increase the sample efficiency of the meta-optimization. We demonstrate the capabilities of our sample-efficient AutoRL approach in a case study with the popular TD3 algorithm in the MuJoCo benchmark suite, where we reduce the number of environment interactions needed for meta-optimization by up to an order of magnitude compared to population-based training.
研究の動機と目的
- 深層強化学習(RL)におけるハイパーパramータ最適化(HPO)の高いサンプル複雑性が現実世界の展開を制限する問題に対処すること。
- 訓練フェーズに跨る動的ハイパーパramータ適応を可能にすることで、RLの非定常性に対処すること。
- 勾配ベースの深層RLにニューラルアーキテクチャ探索(NAS)を統合し、計算コストを最小限に抑えること。
- 実際の環境相互作用コストを考慮した公平なAutoRL評価プロトコルの開発。
- 共有経験を介したハイパーパramータとアーキテクチャの共同最適化が、優れたサンプル効率を達成できることを示すこと。
提案手法
- 多様なハイパーパramータとアーキテクチャを持つ複数のRLエージェントを同時に訓練する、パopulationベースの進化的フレームワーク。
- パopulation全体に跨る共有リプレイメモリを採用し、収集された経験を再利用することでサンプル効率を向上。
- 訓練済み重みを保持しつつ、深さ、幅、活性化関数を訓練中に変更可能な、変更可能なニューラルネットワーク。
- 進化的な突然変異による動的ハイパーパramータチューニングにより、静的設定ではなく、構成スケジュールを可能に。
- オフポリシーRLアルゴリズム(例:TD3、DQN)と、アルゴリズム的およびアーキテクチャ的ハイパーパramータの両方を共同で最適化。
- 同期的な進化的ループにより、パopulationメンバー間の連携を確保するとともに、重複する環境相互作用を最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1RLエージェントのパopulationに跨る共有経験リプレイは、メタ最適化に必要な環境相互作用の回数を顕著に削減できるか?
- RQ2訓練中に動的ハイパーパramータ適応を実施することで、静的設定と比較して最終的な性能が向上するか?
- RQ3勾配ベースの深層RLに、最小限の計算コストでニューラルアーキテクチャ進化を効果的に統合できるか?
- RQ4ランダムサーチやパopulationベーストレーニング(PBT)と比較して、SEARLのサンプル効率および最終的な性能はいかがなものか?
- RQ5SEARLは、オフポリシーおよびオンポリシーの両設定を含む、異なるRLアルゴリズムや環境に一般化できるか?
主な発見
- MuJoCoベンチマークにおいて、ランダムサーチやPBTと比較して、SEARLはメタ最適化に必要な環境相互作用回数を最大10倍(10×)まで削減した。
- 5つのMuJoCo環境のうち4つにおいて、SEARLは最良のランダムサーチおよびPBT設定と同等またはそれ以上の性能を達成した。
- 共有リプレイメモリの使用により、SEARLは単一エージェントの訓練とほぼ同等のサンプルコストでAutoRLを実行でき、環境相互作用のオーバーヘッドとしてはほぼ「無料」とも言える。
- SEARLは、訓練フェーズに跨る適応的ハイパーパramータスケジュールを発見し、RL問題の非定常性に対処した。
- SEARLは他のアルゴリズムにも一般化でき、5つのAtari環境のうち4つでは、ランダムサーチで得られた最良の設定を上回った(Rainbow DQNをチューニングする際)。
- SEARLは、単一のTD3実行に必要な環境相互作用の2倍の回数しか必要としないが、同時にハイパーパramータとアーキテクチャの最適化を実行でき、顕著なサンプル効率を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。