Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Policy Gradients via Alpha Divergence Dropout Inference

Peter Henderson, Thang Doan|arXiv (Cornell University)|Dec 6, 2017
Advanced Bandit Algorithms Research参考文献 16被引用数 14
ひとこと要約

本論文では、方策勾配強化学習における価値関数分布の推定に、alpha-損失ドロップアウト推論を用いたベイジアンニューラルネットワーク(BNN)を提案する。これは、決定的価値ネットワークの代わりに用いるものである。不確実性を考慮した価値関数からのマルコフモンテカルロ後方平均推定を活用することで、MuJoCoの連続制御ベンチマークにおいてPPO、TRPO、DDPGのすべての設定で学習の安定性と性能が著しく向上し、一部の環境では最大34%の性能向上が達成された。

ABSTRACT

Policy gradient methods have had great success in solving continuous control tasks, yet the stochastic nature of such problems makes deterministic value estimation difficult. We propose an approach which instead estimates a distribution by fitting the value function with a Bayesian Neural Network. We optimize an $α$-divergence objective with Bayesian dropout approximation to learn and estimate this distribution. We show that using the Monte Carlo posterior mean of the Bayesian value function distribution, rather than a deterministic network, improves stability and performance of policy gradient methods in continuous control MuJoCo simulations.

研究の動機と目的

  • 連続制御のための方策勾配法における高い分散と不安定性を、価値関数推定における不確実性のモデル化によって解決すること。
  • 決定的価値ネットワークをベイジアンニューラルネットワークに置き換えることで、深層強化学習における学習の安定性と性能を向上させること。
  • ドロップアウトに基づく変分推論による不確実性を考慮した価値関数推定が、方策勾配アルゴリズムをどのように改善するかを調査すること。
  • PPO、TRPO、DDPGといった広く使われているアルゴリズムにおけるベイジアン価値関数近似の影響を評価すること。
  • 特に初期学習段階において、不確実性が探索と正則化に果たす役割を調査すること。

提案手法

  • 価値関数を点推定ではなく分布としてモデル化するために、ベイジアンニューラルネットワーク(BNN)を用いる。
  • ネットワーク重みの後方分布推定のため、マルコフモンテカルロドロップアウトを変分推論の近似として適用する。
  • 不確実性推定と後方分布近似の精度を向上させるために、alpha-損失の目的関数を最適化する。
  • 学習の安定化のため、方策更新時にBNN価値関数のマルコフモンテカルロ後方平均を用いる。
  • PPO、TRPO、DDPGといった標準的な方策勾配フレームワークに、最小限のアーキテクチャ変更でBNN価値関数を統合する。
  • ドロップアウト率、マルコフモンテカルロサンプル数、温度パラメータτといったハイパーパrameterを調整し、最適化と正則化のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1alpha-損失ドロップアウトによるベイジアン価値関数推定は、連続制御における方策勾配法の安定性と性能を向上させることができるか?
  • RQ2BNN価値関数の後方平均を用いる場合と決定的価値ネットワークを用いる場合とを比較したとき、学習の安定性と最終的リターンにどのような差が生じるか?
  • RQ3不確実性推定は、特にPPOの初期学習段階における探索にどのような影響を与えるか?
  • RQ4ドロップアウト率やτといったハイパーパrameterは、異なるアルゴリズムにおいて性能と一般化性能にどのように影響を与えるか?
  • RQ5Double-DQNと同様に、BNNベースの価値関数はQ値推定における過大評価バイアスを低減するか?

主な発見

  • PPOは、BNN価値関数を用いることでHalfCheetah-v1で最終平均リターン2790 ± 284を達成し、ベースライン(2155 ± 177)およびL2正則化バージョン(2030 ± 234)と比較して有意に向上(p < 0.05)。
  • TRPOは、BNN価値関数を用いることでHalfCheetah-v1で15%の性能向上(3026 ± 144 vs. 2605 ± 313)を示し、学習の安定性が向上したことを示した。
  • DDPGは、BNN価値関数を用いることでHalfCheetah-v1で最終リターン4772 ± 736を達成し、ベースライン(4159 ± 762)を上回り、Q値の過大評価が軽減された。
  • 乱数シードごとの標準誤差が低減されたことから、学習曲線の一貫性が向上し、より高いロバストネスを示した。
  • アブレーションスタディの結果、高いドロップアウト率と最適なτ値が、特にPPOにおいて性能向上に寄与しており、探索と正則化の両方が強化されたことが示された。
  • マルコフモンテカルロドロップアウトのアンサンブル的効果により、Q値推定の分散が低減され、Double-DQNと同様の効果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。