Skip to main content
QUICK REVIEW

[論文レビュー] On the Estimation Bias in Double Q-Learning

Zhizhou Ren, Guangxiang Zhu|arXiv (Cornell University)|Sep 29, 2021
Domain Adaptation and Few-Shot Learning参考文献 46被引用数 12
ひとこと要約

本稿では、二重Q学習が低推定バイアスを引き起こし、価値推定において複数の非最適固定点が生じることを特定している。これを解決するために、著者らは二重に束縛されたQ学習を提案する。この手法は、抽象化された動的計画法(ADP)モジュールを下界推定器として用い、低推定を是正することで、ベースラインと比較してアタリベンチマークタスクにおけるサンプル効率と収束性を著しく向上させる。

ABSTRACT

Double Q-learning is a classical method for reducing overestimation bias, which is caused by taking maximum estimated values in the Bellman operation. Its variants in the deep Q-learning paradigm have shown great promise in producing reliable value prediction and improving learning performance. However, as shown by prior work, double Q-learning is not fully unbiased and suffers from underestimation bias. In this paper, we show that such underestimation bias may lead to multiple non-optimal fixed points under an approximate Bellman operator. To address the concerns of converging to non-optimal stationary solutions, we propose a simple but effective approach as a partial fix for the underestimation bias in double Q-learning. This approach leverages an approximate dynamic programming to bound the target value. We extensively evaluate our proposed method in the Atari benchmark tasks and demonstrate its significant improvement over baseline algorithms.

研究の動機と目的

  • 二重Q学習における収束の不完全さの根本的原因、特に低推定バイアスに起因するものを探る。
  • 近似誤差が二重Q学習におけるベルマン作用素において複数の非最適固定点を生じる要因となる構造的性質を分析する。
  • 低推定バイアスを低減し、深層強化学習における最適方策への収束を改善する手法を提案する。
  • 抽象化された動的計画法と二重Q学習を組み合わせることで、より良い価値推定が達成されるかを検証する。

提案手法

  • 著者らは、ターゲット価値の下界推定を提供するため、抽象化された動的計画法(ADP)モジュールを用いた二重に束縛された推定器を導入する。
  • ADPモジュールは、簡略化されたMDPモデルを用いて真の価値関数を近似するように独立に訓練され、保守的な境界を提供する。
  • 最終的なQ値推定は、二重Q学習のターゲットとADPの下界を組み合わせることで、低推定のリスクを低減する。
  • 本手法はDDQNやクリッピング済み二重Q学習といった既存のアルゴリズムと統合可能であり、アーキテクチャの変更を最小限に抑える。
  • ADPモジュールは、モンテカルロ収益をターゲットとして用い、状態-行動ペアのデータセット上で教師あり学習により訓練される。
  • 全体の訓練目的は、ベルマン誤差を最小化するとともに、ADP推定器を用いて価値推定を制約する。

実験結果

リサーチクエスチョン

  • RQ1二重Q学習における低推定バイアスが、価値関数において複数の非最適固定点を引き起こすことはあるか?
  • RQ2ベルマン作用素が近似誤差の下で非最適解への収束に脆弱である要因となる構造的性質は何か?
  • RQ3抽象化された動的計画法モジュールが、二重Q学習における低推定を是正する有効な下界として機能できるか?
  • RQ4ADP推定器を統合することで、深層強化学習におけるサンプル効率と収束速度が向上するか?

主な発見

  • 二重Q学習は、ほぼ決定的環境ですら、低推定バイアスのため複数の非最適固定点に収束する可能性がある。
  • 提案された二重に束縛されたQ学習手法は、抽象化された動的計画法モジュールを保守的な下界として組み込むことで、低推定を低減する。
  • アタリ57ベンチマークにおいて、本手法はDDQNやクリッピング済み二重Q学習と比較して、サンプル効率と収束速度の面で顕著な改善を示した。
  • アブレーションスタディの結果、ADPモジュール単体では不十分であるが、ブートストラップと組み合わせることで性能が著しく向上することが確認された。
  • 訓練バッチ全体にわたってターゲット値の標準偏差が低減され、より安定した学習ダイナミクスであることが示された。
  • 複数のアタリ環境において、平均およびメジアンのヒューマン正規化スコアの両面で、本手法はベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。