QUICK REVIEW
[論文レビュー] Muesli: Combining Improvements in Policy Optimization
Matteo Hessel, Ivo Danihelka|arXiv (Cornell University)|Apr 13, 2021
Reinforcement Learning in Robotics参考文献 88被引用数 12
ひとこと要約
Muesliは、正則化された方策最適化とモデルベースの1ステップ先読み価値推定を組み合わせた新しい方策最適化手法を提案し、深さのない探索を用いながらもAtariゲームで最先端の性能を達成した。深さのない探索と1ステップ計画を用いながらも、ポリシーネットワークのみでMuZeroの結果に匹敵し、モデルフリー手法と同等の計算速度を維持した。
ABSTRACT
We propose a novel policy update that combines regularized policy optimization with model learning as an auxiliary loss. The update (henceforth Muesli) matches MuZero's state-of-the-art performance on Atari. Notably, Muesli does so without using deep search: it acts directly with a policy network and has computation speed comparable to model-free baselines. The Atari results are complemented by extensive ablations, and by additional results on continuous control and 9x9 Go.
研究の動機と目的
- 深さのない探索や計画に依存せずに、Atariで最先端の性能を達成する方策最適化手法の開発。
- モデルベースの価値推定を正則化された方策最適化に統合し、サンプル効率とロバストネスの向上。
- 木探索の遅延を回避するため、ポリシーネットワークを直接用いて高速な計算効率を維持。
- 連続制御や9×9ゴーを含む多様な環境における一般化性能の評価。
- 本手法の主要な構成要素をアブレーションし、性能への寄与を理解すること。
提案手法
- MuesliはMuZeroを模倣したモデルを用い、1ステップ先読みによる行動価値推定を行い、ブートストラップされた価値ターゲットを提供する。
- 最大事後確率方策最適化(MPO)フレームワーク内にクリッピングされた正規化されたアドバンテージ機構を採用し、訓練の安定化とスケーリング問題の回避を図る。
- クリッピングされたMPOターゲットとポリシー勾配を直接組み合わせたエンドツーエンドの最適化スキームでポリシーを更新する。
- ポリシー勾配推定の分散低減のため、行動依存のベースライン(β-LOO)を組み込む。
- パラメータ共有を可能にするために、ポリシーと価値関数推定に共通のニューラルネットワークを用いる。
- モデルフリー設定で動作するが、ポリシー学習の改善を目的として、学習済みモデルを補助損失として活用する。
実験結果
リサーチクエスチョン
- RQ1正則化された方策最適化とモデルベースの価値推定を組み合わせることで、深さのない探索を用いずにAtariで最先端の性能を達成できるか?
- RQ21ステップのモデルベース価値推定の使用が、サンプル効率と訓練安定性をどのように向上させるか?
- RQ3クリッピングされた正規化アドバンテージと行動依存ベースラインのポリシー最適化性能への寄与は何か?
- RQ4Muesliは連続制御環境および小規模な9×9ゴー環境にどのように一般化するか?
- RQ5Atariにおける性能に最も重要な寄与をするアブレーション要因は何か?
主な発見
- Muesliは、深さのない探索を用いずに、57種類のAtariゲームでMuZeroと同等の中央値のヒューマン正規化スコアを達成し、標準的な75%リプレイ設定で139,409 ± 12,178を記録した。
- 大規模なMuZero設定(95%リプレイ、より大きなネットワーク)では、Muesliが1,363,427 ± 81,093を達成し、報告されたMuZeroのスコア1,355,410 ± 65,349を上回った。
- アブレーション研究では、β-LOOベースラインの使用が性能を顕著に向上させた一方、温度パラメータ付きソフトマックスやCMPOなしの直接ポリシー実行では結果が悪化した。
- 連続制御環境への一般化は良好であり、MuJoCoベンチマークでも優れた性能を示した。
- 9×9ゴーにおいて、Muesliは強力な自己対戦性能を達成し、従来モンテカルロ木探索に依存していた分野でも有効性を示した。
- スタックドフレームのアブレーションでは、Muesliが異なる観測履歴に対しても性能を維持しており、入力表現に対して頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。