[論文レビュー] SEERL: Sample Efficient Ensemble Reinforcement Learning
SEERLは、サイクル学習率を用いてモデル重みに指向的な摂動を加えることで、1回の学習実行から多様で高性能な方策を生成する、サンプル効率の高いフレームワークを提案する。この手法は、先行のアンサンブル手法と比較して、はるかに低いサンプル数および計算コストでAtari 2600およびMuJoCo環境で最先端の性能を達成する。
Ensemble learning is a very prevalent method employed in machine learning. The relative success of ensemble methods is attributed to their ability to tackle a wide range of instances and complex problems that require different low-level approaches. However, ensemble methods are relatively less popular in reinforcement learning owing to the high sample complexity and computational expense involved in obtaining a diverse ensemble. We present a novel training and model selection framework for model-free reinforcement algorithms that use ensembles of policies obtained from a single training run. These policies are diverse in nature and are learned through directed perturbation of the model parameters at regular intervals. We show that learning and selecting an adequately diverse set of policies is required for a good ensemble while extreme diversity can prove detrimental to overall performance. Selection of an adequately diverse set of policies is done through our novel policy selection framework. We evaluate our approach on challenging discrete and continuous control tasks and also discuss various ensembling strategies. Our framework is substantially sample efficient, computationally inexpensive and is seen to outperform state-of-the-art (SOTA) scores in Atari 2600 and Mujoco.
研究の動機と目的
- アンサンブル強化学習における複数の独立した方策を学習する際の高いサンプル複雑性と計算コストを解決すること。
- 追加の学習オーバーヘッドなしに、1回の学習実行から多様で高性能な方策を生成する手法を開発すること。
- 劣悪な方策をフィルタリングし、最適なアンサンブルを形成するための、方策選択フレームワークを設計すること。
- サイクル学習率による指向的摂動が、ランダム摂動とは異なり、有効な方策多様性を生み出すために不可欠であることを示すこと。
- 方策の多様性が極端に高いとアンサンブル性能が低下することを示し、バランスの取れた選択戦略の必要性を明らかにすること。
提案手法
- サイクル学習率を用いて定期的にモデル重みを摂動させ、勾配に沿った指向的移動を誘発し、鋭い局所最適解への収束を防ぐ。
- 複数の並列学習ランの必要性を回避するために、1つのニューラルネットワークから順次多様な方策を生成する。
- 訓練中の軌道に基づいて方策を評価・選択する、新しい方策選択フレームワークを採用する。
- 状態間での行動分布のKLダイバージェンスを用いて、方策多様性を定量化・検証する。
- オンポリシー(例:A2C)およびオフポリシー(例:SAC)の強化学習アルゴリズムの両方へ適用可能であることを示し、広範な適用可能性を確認する。
- 多様性と性能のバランスを取るために、方策数(M)や最大学習率などのハイパーパrameterを最適化する。
実験結果
リサーチクエスチョン
- RQ11回の学習実行で、従来のアンサンブル手法を上回る多様な方策のアンサンブルを生成できるか?
- RQ2サイクル学習率によるモデル重みの指向的摂動は、ランダム摂動よりも方策多様性および性能向上に優れているか?
- RQ3最適な方策多様性のレベルは何か?過度な多様性はアンサンブル性能を低下させるか?
- RQ4提案された方策選択フレームワークは、単純なアンサンブル平均と比較して、どのようにアンサンブル性能を向上させるか?
- RQ5SUNRISEなどの既存のアンサンブル手法と比較して、SEERLはどの程度サンプル効率を達成しているか?
主な発見
- SEERLは、Atari 2600およびMuJoCo環境で最先端の手法を上回り、はるかに少ないサンプル相互作用数でSOTAスコアを達成した。
- 複数のネットワークを並列に学習するSUNRISEと比較して、1つのネットワークで順次学習するアプローチのおかげで、SEERLは最大10倍速くなった。
- サイクル学習率を用いた指向的摂動は、ランダム摂動よりもはるかに多様で効果的な方策を生成した。
- 極めて多様な方策はアンサンブル性能を低下させることを確認し、多様性は過剰であってはならず、バランスの取れた戦略が不可欠であることを示した。
- 方策選択フレームワークは劣悪な方策を効果的にフィルタリングし、高品質で相補的な方策を選択することで、アンサンブル性能を向上させた。
- Mが3から7の範囲でSEERLは最適な性能を達成した。Mが高くなると、1方策あたりの学習時間が短くなり、結果が劣化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。