Skip to main content
QUICK REVIEW

[論文レビュー] Quantile Reinforcement Learning

Hugo Gilbert, Paul Weng|arXiv (Cornell University)|Nov 3, 2016
Auction Theory and Applications被引用数 6
ひとこと要約

本論文では、期待累積報酬の代わりに分位数基準に基づく最適化を目的とする、2段階スケールの確率的近似を用いたQuantile Q-learningというアルゴリズムを提案する。この手法は、『誰がマレットを望むか』シミュレーションにおいて、結果の30番目のパーセンタイルを最大化することに成功し、安定した方策および価値関数の学習を経て、目標分位数値0.7に収束した。

ABSTRACT

In reinforcement learning, the standard criterion to evaluate policies in a state is the expectation of (discounted) sum of rewards. However, this criterion may not always be suitable, we consider an alternative criterion based on the notion of quantiles. In the case of episodic reinforcement learning problems, we propose an algorithm based on stochastic approximation with two timescales. We evaluate our proposition on a simple model of the TV show, Who wants to be a millionaire.

研究の動機と目的

  • 標準的な強化学習が期待累積報酬に依存するという限界を克服するため、分位数基準に基づくパフォーマンス基準を最適化する手法を提案すること。
  • 順序的フィードバックしか入手できない状況や、極端な結果に対してロバストであることが重要な状況での学習を可能にすること。
  • 平均ではなく、報酬分布の特定の分位数を最適化する方策を学習する強化学習アルゴリズムを開発すること。
  • 歪んだ報酬分布を示す現実世界のエピソード的意思決定環境において、この手法の実証的妥当性を検証すること。

提案手法

  • 本手法は2段階スケールの確率的近似を採用しており、Q関数は速いスケールで、分位数パラメータθは遅いスケールで更新される。
  • 収束条件を満たすために、学習率α(n) = 1/(n+1)^1.1を用いた修正されたQ学習更新ルールとε-greedy探索を採用する。
  • 現在の推定値V*θ(s₀)が目標分位数1−τより低いか高いかに基づき、ステップサイズ1/nを用いて分位数パラメータθを更新する。
  • 方策は、θを調整することで報酬分布の分位数を所望のパーセンタイル(例:τ=0.3で30番目のパーセンタイル)にシフトさせることで、間接的に最適化される。
  • 最終状態の訪問頻度ベクトルfを維持し、fと報酬ベクトルのクロス積を計算することで、方策の実証的パフォーマンスを追跡する。
  • 収束は2段階スケールの確率的近似理論枠組み(Borkar, 2008)により保証され、θはV*θ(s₀) = 1−τを満たす値に収束する。

実験結果

リサーチクエスチョン

  • RQ1期待値ではなく報酬分布の分位数を最適化することを目的とした強化学習は、効果的に適用可能か?
  • RQ22段階スケールの確率的近似フレームワークを用いて、累積報酬の特定の分位数を最大化する方策を学習することは可能か?
  • RQ3本手法は、歪んだ報酬分布を示す現実世界のエピソード的意思決定タスクにおいて、実証的にどの程度のパフォーマンスを示すか?
  • RQ4アルゴリズムはどのように目標分位数に収束するのか?また、θパラメータは報酬分布の形状にどのような役割を果たすか?

主な発見

  • アルゴリズムは、報酬の30番目のパーセンタイルを最大化する方策を成功裏に学習した。1000万回の学習ステップを経て、V*θ(s₀)は目標値0.7(1−τ)に収束した。
  • 方策の実証的パフォーマンスを表すスコアは約0.7に収束したが、探索の影響によりわずかに下回った。
  • パラメータθは安定した値4に収束し、これはV*θ(s₀) = 0.7を達成する分位数パラメータに対応する。
  • 学習が進むにつれ、V*θ(s₀)は0.7の周りで減少する振動を示し、安定した収束を示した。
  • 学習率α(n) = 1/(n+1)^1.1は収束に必要な条件を満たしており、漸近的安定性を保証した。
  • 本手法は、『誰がマレットを望むか』のような歪んだ報酬分布を示すドメインにおいて、ロバストであることが示された。ここでは、平均よりも中央値や下位分位数を最大化することがより重要である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。