[论文解读] Epistemic Risk-Sensitive Reinforcement Learning
本文提出了一种贝叶斯强化学习框架,通过使用由 β 参数化的效用函数来建模对认知不确定性的风险敏感性,从而实现风险规避、风险中性或风险寻求行为。该框架提出了动态规划与策略梯度算法,通过基于效用的回报优化来控制风险,在具有离散与连续状态空间的不确定MDP中,风险规避策略可减少探索并提高鲁棒性。
We develop a framework for interacting with uncertain environments in reinforcement learning (RL) by leveraging preferences in the form of utility functions. We claim that there is value in considering different risk measures during learning. In this framework, the preference for risk can be tuned by variation of the parameter $β$ and the resulting behavior can be risk-averse, risk-neutral or risk-taking depending on the parameter choice. We evaluate our framework for learning problems with model uncertainty. We measure and control for \emph{epistemic} risk using dynamic programming (DP) and policy gradient-based algorithms. The risk-averse behavior is then compared with the behavior of the optimal risk-neutral policy in environments with epistemic risk.
研究动机与目标
- 开发一个统一的框架,用于在认知不确定性下进行风险敏感的强化学习,其中不确定性源于对MDP的不完全知识。
- 通过允许通过参数 β 调整风险偏好的效用函数来建模风险敏感性。
- 在模型不确定性环境中,比较风险规避策略与风险中性策略的表现。
- 在离散(网格世界)与连续(期权定价)环境中,评估基于效用的风险敏感性的性能。
- 证明在认知不确定性下,风险规避策略可减少探索并提高鲁棒性。
提出的方法
- 通过回报 R 的期望效用来形式化风险敏感性,其中凹效用函数导致风险规避,凸效用函数导致风险寻求行为。
- 使用 MDP μ 的贝叶斯信念 ξ 来计算最优策略:argmaxπ ∫ℳ 𝔼μ^π[U(R)] dξ(μ),对模型不确定性进行积分。
- 在离散MDP中使用动态规划(ADP),在连续状态空间中使用贝叶斯策略梯度(EBPG)算法。
- 对奖励函数和转移核使用高斯过程先验,以建模环境中的认知不确定性。
- 通过效用函数 U(R) = -exp(-βR) 中的 β 参数调节风险偏好,其中 β > 0 表示风险规避,β = 0 表示风险中性,β < 0 表示风险寻求。
- 通过从后验信念中对 MDP 进行蒙特卡洛采样,来估计期望效用并更新策略。
实验结果
研究问题
- RQ1对认知不确定性的风险敏感性如何影响部分可观察MDP中的策略学习与探索行为?
- RQ2基于效用的风险敏感性是否能通过可调参数 β 有效控制开发与探索之间的权衡?
- RQ3在模型不确定性下,风险规避策略与风险中性策略在遗憾与失败率方面有何差异?
- RQ4基于效用的风险敏感性对连续状态空间环境中学习的稳定性和收敛性有何影响?
- RQ5效用函数是否可用于诱导结构化探索,而无需额外的奖励塑形或熵正则化?
主要发现
- 风险规避策略(β > 0)相比风险中性策略表现出显著减少的探索,从而在网格世界环境中导致更低的遗憾。
- 在网格世界实验中,风险规避策略的表现与风险中性策略几乎相同,仅导致轻微的失败次数增加(跌倒次数)。
- 当 β = -0.001 时,策略过于谨慎;而 β = -0.01 和 β = -0.1 的行为与风险中性PG相似,表明风险寻求行为存在阈值效应。
- 贝叶斯策略梯度(EBPG)算法在连续状态空间环境中成功学习了风险敏感策略,尽管由于昂贵的MDP采样导致训练速度较慢。
- 基于CVaR的策略与 β = -0.001 的策略过于保守,表明使用小 β 的基于效用的风险敏感性可能导致次优探索。
- 该框架可通过调节 β 参数灵活调节风险偏好,而无需修改底层强化学习算法,展示了处理认知不确定性的灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。