Skip to main content
QUICK REVIEW

[論文レビュー] Exponential Bellman Equation and Improved Regret Bounds for Risk-Sensitive Reinforcement Learning

Yingjie Fei, Zhuoran Yang|arXiv (Cornell University)|Nov 6, 2021
Decision-Making and Behavioral Economics被引用数 9
ひとこと要約

本稿では、エントロピックリスク測度下でのリスクセンシティブ強化学習における、既存の上界と下界のレグレットの指数的ギャップを解消するために、新規の指数的ベルマン方程式と二重に減衰するボーナス機構を提案する。ベルマンバックアップの分析を精緻化し、探索を改善することで、先行研究に見られる $e^{|\beta|H^2}$ 因子を排除したほぼ最適なレグレットバウンドを達成した。これにより、既知の下界とのギャップが顕著に縮小された。

ABSTRACT

We study risk-sensitive reinforcement learning (RL) based on the entropic risk measure. Although existing works have established non-asymptotic regret guarantees for this problem, they leave open an exponential gap between the upper and lower bounds. We identify the deficiencies in existing algorithms and their analysis that result in such a gap. To remedy these deficiencies, we investigate a simple transformation of the risk-sensitive Bellman equations, which we call the exponential Bellman equation. The exponential Bellman equation inspires us to develop a novel analysis of Bellman backup procedures in risk-sensitive RL algorithms, and further motivates the design of a novel exploration mechanism. We show that these analytic and algorithmic innovations together lead to improved regret upper bounds over existing ones.

研究の動機と目的

  • 既存のリスクセンシティブRLアルゴリズムに内在する欠陥を特定し、エントロピックリスク測度下で上界と下界のレグレットバウンドの間の指数的ギャップを生じさせることを目的とする。
  • 先行手法の非最適な解析と、レグレット上界に $e^{|eta|H^2}$ 因子を生じさせる過剰な探索ボーナスを是正することを目的とする。
  • リスクセンシティブRLのための新たな分析枠組みを、指数的ベルマン方程式に基づいて構築することを目的とする。
  • 推定誤差に適応する水平方向のステップごとに減衰する、新規の探索メカニズム「二重に減衰するボーナス」を設計することを目的とする。
  • $e^{|eta|H^2}$ 因子を排除することで、既存の下界とほぼ一致するレグレットバウンドを達成することを目的とする。

提案手法

  • 報酬と次ステップの価値関数の間の乗法的相互作用を用いることで、標準的なRLとは対照的に加法的更新とは異なった形で、リスクセンシティブベルマン更新を再定式化する指数的ベルマン方程式を導入する。
  • 指数的ベルマン方程式に基づくベルマンバックアップ手順の新たな分析を構築し、その構造的性質を活用して誤差バウンドをより厳密に導出する。
  • エピソード全体および各エピソード内での両方の段階で減衰する二重に減衰するボーナス機構を提案する。これにより、過大評価を低減し、レグレットスケーリングを改善する適応的探索が可能になる。
  • リスクセンシティブRLに適応する2つのモデルフリーなアルゴリズム、RSVI-ED および RSQ-ED を設計し、指数的ベルマン方程式と二重に減衰するボーナスを統合する。
  • 集中不等式と自己正規化マルティングルールを用いて、指数的価値関数における推定誤差を制御し、高確率でのレグレットバウンドを保証する。
  • 対数関数の1-Lipschitz性または $e^{-\beta H}$-Lipschitz性を活用し、元の価値関数におけるレグレットと指数的価値関数との関係を確立することで、よりタイトなレグレット分解を可能にする。

実験結果

リサーチクエスチョン

  • RQ1なぜリスクセンシティブRLにおける既存のレグレット上界に、下界には存在しない $e^{\beta|H^2}$ 因子が含まれているのか?
  • RQ2改善されたアルゴリズム設計と分析によって、上界と下界の間の指数的ギャップを埋めることは可能か?
  • RQ3リスクセンシティブベルマン方程式の構造をどのように活用すれば、価値関数推定誤差のよりタイトなバウンドを導出できるか?
  • RQ4どのような新規な探索メカニズムが、リスクセンシティブRLにおいて過大評価を効果的に低減しつつ、十分な探索を維持できるか?
  • RQ5提案手法は、先行の上界に含まれる $e^{\beta|H^2}$ 因子を排除し、ほぼ最適なレグレットバウンドを達成できるか?

主な発見

  • 本稿では、既存のアルゴリズムが、過剰なボーナスと最適でない解析により、リスクセンシティブベルマン方程式の乗法的構造を十分に活用できていないことが特定された。
  • 提案された指数的ベルマン方程式は、報酬と次ステップの価値関数の間の乗法的相互作用を用いることで、更新ルールを再定式化し、推定誤差のより正確な分析を可能にした。
  • 二重に減衰するボーナス機構は、エピソード間および各エピソード内での両方の段階で探索を段階的に減少させ、よりタイトなレグレット制御を実現した。
  • レグレット上界は $e^{\beta|H^2}$ 因子を排除することで改善され、下界と対数的および多項式的要因を除いてほぼ最適なバウンドが得られた。
  • $\beta > 0$ の場合、レグレットは $\frac{1}{\beta} \sum_{k \in [K]} \left[ e^{\beta V_1^k(s_1^k)} - e^{\beta V_1^{\pi^k}(s_1^k)} \right]$ で抑えられ、$\beta < 0$ の場合、$\frac{e^{-\beta H}}{|\beta|} \sum_{k \in [K]} \left[ e^{\beta V_1^{\pi^k}(s_1^k)} - e^{\beta V_1^k(s_1^k)} \right]$ で抑えられる。これは先行研究の結果よりもタイトである。
  • 分析により、$\gamma_{h,t} \leq 4c|e^{\beta(H-h+1)} - 1|\sqrt{\frac{H\iota}{t}}$ が得られ、指数的価値関数における推定誤差のより洗練されたバウンドが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。