[论文解读] Risk-Averse Bayes-Adaptive Reinforcement Learning
本文提出风险规避型贝叶斯自适应蒙特卡洛树搜索(RA-BAMCP),一种在贝叶斯自适应马尔可夫决策过程(BAMDP)中优化总体回报条件风险价值(CVaR)的算法,以同时应对认知不确定性与随机性不确定性。通过将问题形式化为两方随机博弈,并结合蒙特卡洛树搜索与贝叶斯优化,RA-BAMCP在投注与导航领域均显著优于基线方法,尤其在降低糟糕回报的可能性方面表现突出。
In this work, we address risk-averse Bayes-adaptive reinforcement learning. We pose the problem of optimising the conditional value at risk (CVaR) of the total return in Bayes-adaptive Markov decision processes (MDPs). We show that a policy optimising CVaR in this setting is risk-averse to both the parametric uncertainty due to the prior distribution over MDPs, and the internal uncertainty due to the inherent stochasticity of MDPs. We reformulate the problem as a two-player stochastic game and propose an approximate algorithm based on Monte Carlo tree search and Bayesian optimisation. Our experiments demonstrate that our approach significantly outperforms baseline approaches for this problem.
研究动机与目标
- 解决存在认知与随机性不确定性的基于模型的贝叶斯强化学习中的风险规避决策问题。
- 在贝叶斯自适应马尔可夫决策过程(BAMDP)中优化总体回报的条件风险价值(CVaR),以增强对罕见但高影响负面结果的鲁棒性。
- 开发一种高效算法,以应对 CVaR 优化中增强状态空间的指数级增长以及对抗性环境中连续动作空间的挑战。
- 证明通过 CVaR 联合缓解认知与随机性不确定性,可产生比期望值最大化或风险无关方法更可靠、更安全的策略。
- 建立一种基于随机博弈形式化与可扩展近似推理的新框架,用于不确定环境中的风险规避规划。
提出的方法
- 将问题重新表述为智能体与对抗性环境之间的两方随机博弈,其中对手选择动作以最小化智能体的 CVaR。
- 使用蒙特卡洛树搜索(MCTS)探索包含 MDP 状态信念与环境状态的 BAMDP 增强状态空间。
- 采用贝叶斯优化以高效扩展对抗性玩家连续动作空间中的有前景动作。
- 算法维护对 MDP 的信念分布,并在每个 MCTS 节点使用后验更新,以在树中传播不确定性。
- 在回报分布上计算 CVaR 目标,其中风险水平 α 控制对最坏情况结果的置信阈值。
- 由于需要对每个节点进行后验计算,该方法避免根采样,从而限制了可扩展性,但保留了信念更新的准确性。
实验结果
研究问题
- RQ1在贝叶斯自适应马尔可夫决策过程中,对 CVaR 的优化能否有效降低由认知与随机性不确定性引发的糟糕结果风险?
- RQ2基于 CVaR 的风险规避策略在不确定环境中的表现,与期望值最大化和风险无关基线方法相比如何?
- RQ3将 MCTS 与贝叶斯优化结合,能在多大程度上实现高维、不确定 MDP 中可扩展且高效的 CVaR 优化?
- RQ4所提出的带有对抗性环境的随机博弈形式化,是否能产生比标准贝叶斯强化学习方法更鲁棒的策略?
- RQ5该算法的性能对 CVaR 指标中风险水平 α 的选择有多敏感?
主要发现
- 在投注游戏领域,RA-BAMCP 在 α=0.03 时达到 CVaR 23.51,在 α=0.2 时达到 18.91,显著优于 CVaR VI EMDP 与 CVaR BAMDP PG 在最坏情况回报上的表现,尤其在低 α 条件下优势明显。
- 在自动驾驶汽车导航领域,RA-BAMCP 在 α=0.03 时达到 CVaR 25.41,在 α=0.2 时达到 27.76,展现出强劲的风险规避性能,同时保持可接受的期望值。
- BAMCP(优化期望值)虽达到最高期望回报(50.16),但方差大且 CVaR 差,表明存在高风险的糟糕结果。
- CVaR BAMDP 策略梯度方法在 α=0.03 时表现极差(CVaR=10.05),且对局部极小值高度敏感,表明在低置信风险设定下存在不稳定性。
- 消融实验表明,动作扩展中的贝叶斯优化至关重要;在相同计算预算下,随机动作扩展导致性能显著下降。
- 回报分布直方图显示,RA-BAMCP 将回报分布的左尾向右移动,降低了极端负面结果的概率,证实了其风险规避特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。