Skip to main content
QUICK REVIEW

[论文解读] Exponential Bellman Equation and Improved Regret Bounds for Risk-Sensitive Reinforcement Learning

Yingjie Fei, Zhuoran Yang|arXiv (Cornell University)|Nov 6, 2021
Decision-Making and Behavioral Economics被引用 9
一句话总结

本文提出了一种新型的指数贝尔曼方程和双重衰减奖励机制,以解决风险敏感强化学习中在熵风险度量下现有上界与下界后悔值之间存在的指数级差距。通过优化贝尔曼备份的分析并改进探索策略,作者实现了几乎最优的后悔值上界,消除了先前工作中存在的 $e^{|eta|H^2}$ 因子,显著缩小了与已知下界之间的差距。

ABSTRACT

We study risk-sensitive reinforcement learning (RL) based on the entropic risk measure. Although existing works have established non-asymptotic regret guarantees for this problem, they leave open an exponential gap between the upper and lower bounds. We identify the deficiencies in existing algorithms and their analysis that result in such a gap. To remedy these deficiencies, we investigate a simple transformation of the risk-sensitive Bellman equations, which we call the exponential Bellman equation. The exponential Bellman equation inspires us to develop a novel analysis of Bellman backup procedures in risk-sensitive RL algorithms, and further motivates the design of a novel exploration mechanism. We show that these analytic and algorithmic innovations together lead to improved regret upper bounds over existing ones.

研究动机与目标

  • 识别现有风险敏感强化学习算法中导致上界与下界后悔值之间存在指数差距的缺陷。
  • 解决先前方法中分析次优和探索奖励过大所导致的 $e^{|eta|H^2}$ 因子在后悔值上界中的问题。
  • 基于指数贝尔曼方程,构建新的分析框架以适用于风险敏感强化学习。
  • 设计一种新颖的探索机制——双重衰减奖励机制,使其能根据时间步长的估计误差自适应调整。
  • 通过消除 $e^{|eta|H^2}$ 因子,实现几乎最优的后悔值上界,从而弥合与现有下界之间的差距。

提出的方法

  • 引入指数贝尔曼方程,该方程通过奖励与下一步值函数之间的乘法交互来重构风险敏感贝尔曼更新,与标准强化学习中的加法更新形成对比。
  • 基于指数贝尔曼方程,发展新的贝尔曼备份过程分析方法,利用其结构特性推导出更紧致的误差界。
  • 提出一种双重衰减奖励机制,其衰减既发生在各次训练轮次之间,也发生在单次轮次内部,从而实现自适应探索,减少过估计并改善后悔值的缩放性能。
  • 设计两种无模型算法——RSVI-ED 和 RSQ-ED,分别整合了指数贝尔曼方程与双重衰减奖励机制,用于风险敏感强化学习。
  • 使用集中不等式和自归一化鞅界限来控制指数值函数中的估计误差,确保高概率下的后悔值上界。
  • 利用对数函数的 1-Lipschitz 或 $e^{-eta H}$-Lipschitz 性质,将原始值函数中的后悔值与指数值函数中的后悔值关联起来,从而实现更紧致的后悔值分解。

实验结果

研究问题

  • RQ1为何现有风险敏感强化学习中的后悔值上界包含一个在下界中不存在的 $e^{|eta|H^2}$ 因子?
  • RQ2能否通过改进算法设计与分析,来弥合上界与下界之间存在的指数级差距?
  • RQ3如何利用风险敏感贝尔曼方程的结构特性,推导出对值函数估计误差的更紧致上界?
  • RQ4何种新颖的探索机制能有效减少过估计,同时在风险敏感强化学习中保持充分探索?
  • RQ5所提出的方法能否实现几乎最优的后悔值上界,并从先前的上界中彻底消除 $e^{|eta|H^2}$ 因子?

主要发现

  • 本文指出,现有算法存在奖励过大且分析未充分挖掘风险敏感贝尔曼方程中乘法结构的缺陷。
  • 所提出的指数贝尔曼方程通过使用奖励与下一步值之间的乘法交互来重构更新规则,从而实现对估计误差的更精确分析。
  • 双重衰减奖励机制在各次训练轮次之间以及单次轮次内部均随时间减少探索,从而实现更紧致的后悔值控制。
  • 通过消除 $e^{|eta|H^2}$ 因子,后悔值上界得到显著改进,得到的上界几乎最优,仅与下界相差对数和多项式因子。
  • 当 $\beta > 0$ 时,后悔值被限制为 $\frac{1}{\beta} \sum_{k \in [K]} \left[ e^{\beta V_1^k(s_1^k)} - e^{\beta V_1^{\pi^k}(s_1^k)} \right] $;当 $\beta < 0$ 时,被限制为 $\frac{e^{-\beta H}}{|\beta|} \sum_{k \in [K]} \left[ e^{\beta V_1^{\pi^k}(s_1^k)} - e^{\beta V_1^k(s_1^k)} \right] $,其紧致性优于先前结果。
  • 分析表明 $\gamma_{h,t} \leq 4c|e^{\beta(H-h+1)} - 1|\sqrt{\frac{H\iota}{t}}$,为指数值函数中的估计误差提供了更精细的上界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。