Skip to main content
QUICK REVIEW

[論文レビュー] Reducing Variance in Temporal-Difference Value Estimation via Ensemble of Deep Networks

Litian Liang, Yaosheng Xu|arXiv (Cornell University)|Sep 16, 2022
Mental Health Research Topics被引用数 4
ひとこと要約

MeanQは、5つの独立した深層Qネットワークの予測を平均化することで、時系列差分(TD)価値推定の分散を低減する単純なアンサンブル深層強化学習手法を提案する。アンサンブル平均化により、SUNRISE や Rainbow DQN といったベースラインを上回る最先端のサンプル効率性を達成し、Atariベンチマークで200K回の相互作用ステップのみで平均的人間水準のパフォーマンスを達成する。

ABSTRACT

In temporal-difference reinforcement learning algorithms, variance in value estimation can cause instability and overestimation of the maximal target value. Many algorithms have been proposed to reduce overestimation, including several recent ensemble methods, however none have shown success in sample-efficient learning through addressing estimation variance as the root cause of overestimation. In this paper, we propose MeanQ, a simple ensemble method that estimates target values as ensemble means. Despite its simplicity, MeanQ shows remarkable sample efficiency in experiments on the Atari Learning Environment benchmark. Importantly, we find that an ensemble of size 5 sufficiently reduces estimation variance to obviate the lagging target network, eliminating it as a source of bias and further gaining sample efficiency. We justify intuitively and empirically the design choices in MeanQ, including the necessity of independent experience sampling. On a set of 26 benchmark Atari environments, MeanQ outperforms all tested baselines, including the best available baseline, SUNRISE, at 100K interaction steps in 16/26 environments, and by 68% on average. MeanQ also outperforms Rainbow DQN at 500K steps in 21/26 environments, and by 49% on average, and achieves average human-level performance using 200K ($\pm$100K) interaction steps. Our implementation is available at https://github.com/indylab/MeanQ.

研究の動機と目的

  • 価値関数推定の分散が高いために生じる深層Q学習の不安定さと過大評価を是正すること。
  • アンサンブル平均化が十分に分散を低減できるかどうかを検証し、バイアスの原因となるとされる遅延ターゲットネットワークの必要性を排除できるかを調査すること。
  • アンサンブル平均化による分散低減が、既存の手法と比較して優れたサンプル効率性とパフォーマンスをもたらすかどうかを実証すること。
  • 共有探索、共有リプレイバッファ、独立したリプレイサンプリングといった重要な設計選択肢が、効果的なアンサンブル学習を可能にする役割を明らかにすること。
  • アブレーションスタディを通じて、パフォーマンス向上の背後にある要因がモデルサイズや更新頻度の増加ではなく、特定に分散低減によるものであることを除外すること。

提案手法

  • 5つの独立した深層Qネットワークのアンサンブルを用いて状態-行動価値を推定し、ターゲット値をアンサンブル予測の平均として計算する。
  • 経験収集中の一貫性を確保するため、アンサンブル平均から導出された共有探索ポリシーを適用する。
  • すべてのアンサンブルメンバーが共有する1つのリプレイバッファを維持し、データ効率と経験の多様性を向上させる。
  • リプレイバッファからの独立した経験サンプリングを実装することで、アンサンブルの多様性を保ち、共適応を防ぐ。
  • すべてのアンサンブルメンバーを同時に確率的勾配降下法で学習させ、ブートストラップターゲット上のTD誤差を最小化する。
  • 遅延ターゲットネットワークを排除し、学習の安定化と分散低減にアンサンブル平均化に依存する。

実験結果

リサーチクエスチョン

  • RQ15つの深層Qネットワークのアンサンブル平均化が、ターゲットネットワークの必要性を排除できるほど価値推定の分散を十分に低減できるか?
  • RQ2独立したリプレイサンプリングは、アンサンブルベースの価値推定のパフォーマンスと安定性にどのように影響するか?
  • RQ3MeanQのパフォーマンス向上は、モデル容量の増加や更新頻度の上昇によるものではなく、分散低減によるものであるとどの程度言えるか?
  • RQ4SUNRISE や Rainbow DQN といった最先端のベースラインと比較して、MeanQ はサンプル効率性と最終パフォーマンスの面でどの程度優れているか?
  • RQ5共有探索と共有リプレイバッファは、アンサンブル手法の有効性にどのような影響を及けるか?

主な発見

  • MeanQは、26のAtari環境のうち16で100K相互作用ステップでSUNRISEを上回り、正規化報酬で平均68%の改善を達成する。
  • 500Kステップで、26の環境のうち21でRainbow DQNを上回り、平均正規化報酬が49%高い。
  • MeanQは、26のAtari環境全体で200K ± 100Kの相互作用ステップのみで平均的人間水準のパフォーマンスに到達する。
  • サイズ5のアンサンブルは、価値推定の分散を十分に低減でき、ターゲットネットワークの必要性を排除できる。これによりさらにサンプル効率性が向上する。
  • アブレーションスタディの結果、MeanQのパフォーマンス向上はモデルサイズや更新頻度の増加によるものではなく、特定にアンサンブル平均化による分散低減に起因することが判明した。
  • 独立したリプレイサンプリングは不可欠である:これを行わない場合、アンサンブルの多様性が低下し、パフォーマンスが著しく低下する。これは、効果的な分散低減に不可欠であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。