[论文解读] Regret Bounds for Markov Decision Processes with Recursive Optimized Certainty Equivalents
本文提出了一种基于递归优化确定等价物(OCEs)的风险敏感强化学习算法,适用于表格型马尔可夫决策过程,其中OCEs是一种统一的风险度量框架,包含熵风险和CVaR。该算法在UCBVI基础上引入了针对OCE的探索奖励,实现了在episode数和动作数上亚线性依赖的最优遗憾界,理论和实证结果均优于现有方法。
The optimized certainty equivalent (OCE) is a family of risk measures that cover important examples such as entropic risk, conditional value-at-risk and mean-variance models. In this paper, we propose a new episodic risk-sensitive reinforcement learning formulation based on tabular Markov decision processes with recursive OCEs. We design an efficient learning algorithm for this problem based on value iteration and upper confidence bound. We derive an upper bound on the regret of the proposed algorithm, and also establish a minimax lower bound. Our bounds show that the regret rate achieved by our proposed algorithm has optimal dependence on the number of episodes and the number of actions.
研究动机与目标
- 解决现有风险敏感强化学习中静态风险度量的局限性,如时间不一致性与非马尔可夫策略问题。
- 为具有未知转移概率的表格型MDP设计一种基于模型的学习算法,采用递归OCE风险度量。
- 建立反映episode数和动作数最优依赖关系的紧致遗憾界。
- 统一并推广现有的风险敏感强化学习公式,包括风险中性、熵风险和基于CVaR的方法。
- 通过在随机生成的MDP上进行实验,验证算法在熵风险和均值-方差风险准则下的性能。
提出的方法
- 基于递归OCEs提出一种新的 episodic 风险敏感强化学习问题,用OCE算子替代标准值迭代中的期望运算。
- 设计一种基于值迭代的OCE-VI算法,引入针对OCE特定效用函数的置信上界(UCB)奖励。
- 推导出一种新颖的探索奖励,其依赖于效用函数的曲率,确保在风险敏感目标下的有效探索。
- 利用集中不等式和KL散度近似,建立理论遗憾界,尤其针对熵风险和均值-方差情形。
- 将UCBVI框架扩展至具有时变转移概率的非平稳MDP,使其适用于有限horizon的episodic设置。
- 在随机生成的MDP上进行数值实验,与基准方法(包括RSVI2、RSQ2和UCBVI变体)进行性能比较。
实验结果
研究问题
- RQ1基于递归OCEs的统一风险敏感强化学习框架,能否在具有未知转移概率的episodic MDP中实现最优遗憾率?
- RQ2OCE中效用函数的选择如何影响探索奖励的设计与学习性能?
- RQ3所提出的OCE-VI算法是否能实现关于episode数和动作数的最优亚线性遗憾?
- RQ4在遗憾和收敛性方面,该算法与现有风险敏感和风险中性强化学习算法相比,实证表现如何?
- RQ5递归OCE公式能否克服CVaR或均值-方差等静态风险度量固有的时间不一致性问题?
主要发现
- 所提出的OCE-VI算法实现了最优依赖于episode数K和动作数A的遗憾界,与最小最大下界一致。
- 在熵风险度量下,该算法在随机生成的MDP上的实证评估中优于RSVI2和RSQ2。
- 在均值-方差准则下,尽管专为风险敏感设置设计,OCE-VI算法显著优于风险中性UCBVI-CH和UCBVI-BF基线方法。
- 理论分析表明,对于熵风险和均值-方差情形,遗憾界为O(√(H^3 S A K log K)),常数取决于效用函数曲率。
- 数值结果证实,遗憾随K呈亚线性增长,且在小型和大型MDP中,该算法收敛更快、遗憾更低。
- OCE特异性奖励项对性能至关重要,因其能根据效用函数编码的风险特征自适应调整探索策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。