[論文レビュー] Rethinking Value Function Learning for Generalization in Reinforcement Learning
本稿では、観測一般化を向上させるために、価値ネットワークの学習頻度を方策ネットワークより低くすることで記憶を抑制し、サンプル効率を向上させる、モデルフリーな方策勾配アルゴリズムであるDelayed-Critic Policy Gradient (DCPG)を提案する。さらに、単一の識別器を用いて前向きおよび逆方向のダイナミクスを同時に最適化する統一的自己教師型ダイナミクス学習タスクを導入し、Procgenベンチマークで202.2 ± 10.2のPPO正規化テストスコアを達成し、最先端の性能を実現した。
Our work focuses on training RL agents on multiple visually diverse environments to improve observational generalization performance. In prior methods, policy and value networks are separately optimized using a disjoint network architecture to avoid interference and obtain a more accurate value function. We identify that a value network in the multi-environment setting is more challenging to optimize and prone to memorizing the training data than in the conventional single-environment setting. In addition, we find that appropriate regularization on the value network is necessary to improve both training and test performance. To this end, we propose Delayed-Critic Policy Gradient (DCPG), a policy gradient algorithm that implicitly penalizes value estimates by optimizing the value network less frequently with more training data than the policy network. This can be implemented using a single unified network architecture. Furthermore, we introduce a simple self-supervised task that learns the forward and inverse dynamics of environments using a single discriminator, which can be jointly optimized with the value network. Our proposed algorithms significantly improve observational generalization performance and sample efficiency on the Procgen Benchmark.
研究の動機と目的
- 価値ネットワークが訓練データを記憶してしまう傾向がある、複数の環境を含む強化学習における観測的過適合を是正すること。
- 価値ネットワークの記憶を低減することで、視覚的に多様な環境における訓練およびテスト性能を向上させること。
- アーキテクチャの分離を回避するため、方策、価値、ダイナミクスネットワークを分離せずに同時に最適化できる単一のネットワークアーキテクチャを構築すること。
- 単一の識別器を用いた自己教師型ダイナミクス学習目的関数を導入し、サンプル効率および一般化性能を向上させること。
- 遅延価値更新とダイナミクス学習が、Procgenベンチマークにおける性能向上に相乗効果をもたらすことを実証すること。
提案手法
- 価値ネットワークの学習頻度を方策ネットワークより低くすることで、価値推定に間接的なペナルティを課し、記憶を低減するDCPGという方策勾配アルゴリズムを提案する。
- 別個の方策ネットワークと価値ネットワークを必要としない、統一されたネットワークアーキテクチャを採用することで、干渉を回避する。
- 単一の識別器を用いて前向きおよび逆方向のダイナミクスを同時に学習する自己教師型タスクを導入し、統合された損失関数を用いる。
- 二重の目的関数を採用する:方策更新のためのクリッピングされた代替方策目的関数と、訓練の安定化を図る遅延価値関数更新。
- ダイナミクス損失を適用し、識別器が本物の遷移(st, at, st+1)と反事実的遷移(st, ˆat, st+1)または(st, at, ˆst+1)を正しく分類するよう促進する。
- 価値ネットワークを方策ネットワークよりも頻度が低く更新するが、より多くの訓練データを用いる遅延クライアント更新スケジュールを採用する。
実験結果
リサーチクエスチョン
- RQ1価値ネットワークの更新頻度を低くすることで、複数環境RLにおける記憶が軽減されるか?
- RQ2単一の統一ネットワークアーキテクチャは、干渉を回避しつつ、方策、価値、ダイナミクスネットワークを効果的に学習できるか?
- RQ3単一の識別器を用いた前向きおよび逆方向のダイナミクスの統合的学習は、状態表現および一般化性能を向上させるか?
- RQ4遅延価値更新と自己教師型ダイナミクス学習による性能向上は、相乗効果を示すか?
- RQ5DCPGはProcgenベンチマークで、観測的一般化およびサンプル効率の面で最先端の性能を達成できるか?
主な発見
- DCPGはProcgenベンチマークで184.5 ± 5.2のPPO正規化テストスコアを達成し、PPO(160.3 ± 6.3)およびPPG(171.7 ± 4.9)を顕著に上回った。
- DCPGに前向きおよび逆方向のダイナミクスの統合的学習を組み合わせた変種DDCPGは、202.2 ± 10.2のPPO正規化テストスコアを達成し、Procgenで新たな最先端性能を樹立した。
- 前向きダイナミクス識別器が有効と分類した分布外(OOD)行動の数は、DCPG+Fの7.05 ± 1.47からDDCPGの0.74 ± 0.75に低下し、行動に依存するダイナミクス理解の向上が示された。
- 別個の識別器を用いるのではなく、単一の識別器を用いた統合的ダイナミクス学習により、OOD行動の誤分類が低減され、行動情報のより効果的な利用が示された。
- 遅延価値更新とダイナミクス学習の組み合わせにより、相乗効果が得られ、DDCPGはDCPGおよびDPPGの両方をテスト性能で上回った。
- RLiableを用いた統計的分析により、95%信頼区間でDDCPGはすべての指標(中央値、IQM、平均)においてPPGを顕著に上回ることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。