Skip to main content
QUICK REVIEW

[論文レビュー] Risk-Sensitive Reinforcement Learning: Near-Optimal Risk-Sample Tradeoff in Regret

Yingjie Fei, Zhuoran Yang|arXiv (Cornell University)|Jun 22, 2020
Reinforcement Learning in Robotics参考文献 58被引用数 9
ひとこと要約

本稿では、指数的効用を介してリスク感受性を組み込むことで、リスク好向きおよびリスク回避的エージェントの両方における適応的探索を可能にする、モデルフリーな強化学習アルゴリズムであるリスク感受性価値反復(RSVI)とリスク感受性Q学習(RSQ)を提案する。著者らは、リスクパラメータ $eta$ およびエピソード長 $H$ に対して指数的依存性を示す近似的最適なレジットバウンドを確立し、このトレードオフが避けられないことを証明し、アルゴリズムの最適性を裏付けた。

ABSTRACT

We study risk-sensitive reinforcement learning in episodic Markov decision processes with unknown transition kernels, where the goal is to optimize the total reward under the risk measure of exponential utility. We propose two provably efficient model-free algorithms, Risk-Sensitive Value Iteration (RSVI) and Risk-Sensitive Q-learning (RSQ). These algorithms implement a form of risk-sensitive optimism in the face of uncertainty, which adapts to both risk-seeking and risk-averse modes of exploration. We prove that RSVI attains an $ ilde{O}\big(λ(|β| H^2) \cdot \sqrt{H^{3} S^{2}AT} \big)$ regret, while RSQ attains an $ ilde{O}\big(λ(|β| H^2) \cdot \sqrt{H^{4} SAT} \big)$ regret, where $λ(u) = (e^{3u}-1)/u$ for $u>0$. In the above, $β$ is the risk parameter of the exponential utility function, $S$ the number of states, $A$ the number of actions, $T$ the total number of timesteps, and $H$ the episode length. On the flip side, we establish a regret lower bound showing that the exponential dependence on $|β|$ and $H$ is unavoidable for any algorithm with an $ ilde{O}(\sqrt{T})$ regret (even when the risk objective is on the same scale as the original reward), thus certifying the near-optimality of the proposed algorithms. Our results demonstrate that incorporating risk awareness into reinforcement learning necessitates an exponential cost in $|β|$ and $H$, which quantifies the fundamental tradeoff between risk sensitivity (related to aleatoric uncertainty) and sample efficiency (related to epistemic uncertainty). To the best of our knowledge, this is the first regret analysis of risk-sensitive reinforcement learning with the exponential utility.

研究の動機と目的

  • 未知の遷移カーネルを有する反復的MDPにおける、証明可能に効率的なモデルフリーなリスク感受性強化学習のためのアルゴリズムを開発すること。
  • リスク感受性の楽観主義を用いて、リスク好向きおよびリスク回避的行動に適応する探索戦略を設計すること。
  • リスク感受性とサンプル効率性の間の根本的トレードオフを定量化するタイトなレジットバウンドを確立すること。
  • レジットにおける $|\beta|$ および $H$ に対する指数的依存性が避けられないことを証明し、提案されたアルゴリズムの近的最適性を裏付けること。
  • 指数的効用関数を用いたリスク感受性強化学習の初のレジット解析を提供すること。

提案手法

  • 指数的効用フレームワークを用いて、リスク感受性の楽観主義を価値更新に適用するバッチアルゴリズムであるリスク感受性価値反復(RSVI)を提案する。
  • リスク感受性の楽観主義原理をQ値学習に拡張するオンラインアルゴリズムとして、リスク感受性Q学習(RSQ)を導入する。
  • リスク中立的($eta \to 0$)からリスク感受性の行動へ滑らかに内挿する指数的効用目的関数 $V = \frac{1}{\beta}\log\mathbb{E}[e^{\beta R}]$ を使用する。
  • リスク感受性の楽観主義メカニズムを採用し、探索ボーナスが $\beta$ の符号および大きさに依存するように設計することで、リスク好向き($eta > 0$)またはリスク回避的($eta < 0$)の好みに適応する。
  • 指数的効用関数によって誘発される非線形ベルマン方程式を考慮する新しい解析を用いて、レジットバウンドを導出する。
  • 任意の $\tilde{O}(\sqrt{T})$ レジットを達成するアルゴリズムが、$|\beta|$ および $H$ に対して指数的コストを負担しなければならないことを示す下界を確立する。

実験結果

リサーチクエスチョン

  • RQ1未知のMDPにおける指数的効用を用いたリスク感受性強化学習に対して、証明可能に効率的なモデルフリーなアルゴリズムを設計できるか?
  • RQ2リスク感受性は強化学習アルゴリズムのサンプル効率性にどのように影響するか?
  • RQ3反復的MDPにおけるリスク感受性とレジットの根本的トレードオフは何か?
  • RQ4レジットバウンドにおける $|\beta|$ および $H$ に対する指数的依存性は避けられないか?
  • RQ5リスク感受性の楽観主義は、リスク好向きおよびリスク回避的設定の両方で効果的に実装可能か?

主な発見

  • RSVIは、$\tilde{O}\big{(}\lambda(|\beta|H^{2})\cdot\sqrt{H^{3}S^{2}AT}\big{)}$ のレジットを達成し、ここで $\lambda(u) = (e^{3u} - 1)/u$ である。
  • RSQは、$\tilde{O}\big{(}\lambda(|\beta|H^{2})\cdot\sqrt{H^{4}SAT}\big{)}$ のレジットを達成し、オンライン学習における効率性を示している。
  • レジットバウンドは、$|\beta|$ および $H$ に対して指数的依存性を示しており、一致する下界によりこれが避けられないことが示されている。
  • 下界は、任意の $\tilde{O}(\sqrt{T})$ レジットを達成するアルゴリズムが、$|\beta|$ および $H$ に対して指数的コストを負担しなければならないことを証明し、提案されたアルゴリズムの近的最適性を裏付けた。
  • 結果は、リスク感受性(アンビエティック不確実性)とサンプル効率性(エピステメティック不確実性)の根本的トレードオフを定量化した。
  • 本研究は、指数的効用を用いたリスク感受性強化学習の初のレジット解析を提供し、理論的強化学習における重要なギャップを埋めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。