[论文解读] Improving Robustness via Risk Averse Distributional Reinforcement Learning
本文提出了一种风险规避的分布式强化学习算法——风险规避SDPG,通过在基于样本的分布式策略梯度框架中优化条件风险价值(CVaR),提升了连续控制任务中策略的鲁棒性。该方法在BipedalWalker、HalfCheetah和Walker2d环境中,面对模型不确定性与动作扰动时,均优于风险中性策略,展现出在噪声或不完美现实部署场景下的更高稳定性和可靠性。
One major obstacle that precludes the success of reinforcement learning in real-world applications is the lack of robustness, either to model uncertainties or external disturbances, of the trained policies. Robustness is critical when the policies are trained in simulations instead of real world environment. In this work, we propose a risk-aware algorithm to learn robust policies in order to bridge the gap between simulation training and real-world implementation. Our algorithm is based on recently discovered distributional RL framework. We incorporate CVaR risk measure in sample based distributional policy gradients (SDPG) for learning risk-averse policies to achieve robustness against a range of system disturbances. We validate the robustness of risk-aware SDPG on multiple environments.
研究动机与目标
- 为解决因模型不确定性与外部扰动导致的仿真训练策略与现实部署之间的鲁棒性差距。
- 通过将风险敏感准则融入分布式强化学习,提升连续控制任务中的策略鲁棒性。
- 利用SDPG中的基于样本的回报分布表示,实现高效且有效的风险规避策略学习。
- 通过实证验证所提方法在多个OpenAI Gym环境中,面对不同水平动作力扰动时的鲁棒性。
提出的方法
- 该方法在基于样本的分布式策略梯度(SDPG)框架基础上,引入条件风险价值(CVaR)作为风险度量,以优化最坏情况下的性能。
- 采用采样回报而非离散类别或分位数表示来建模回报分布,从而实现灵活且高效的敏感风险优化。
- 策略被训练以最大化在指定CVaR水平α下的期望回报,该方法聚焦于回报分布的尾部,降低对罕见但灾难性结果的敏感性。
- 算法使用CVaR的可微分近似,以在SDPG框架内通过策略梯度方法实现端到端训练。
- 在评估过程中通过在动作力上添加均值为零的高斯噪声来模拟扰动,噪声水平从0到1.5×a_max不等,以模拟现实中的执行器缺陷。
- 该方法在每个环境中评估1000条轨迹,并报告回报的累积分布函数(CDF),以分析尾部分布行为与鲁棒性。
实验结果
研究问题
- RQ1在分布式强化学习框架中引入CVaR是否能提升连续控制任务中对动作扰动的策略鲁棒性?
- RQ2在模型不确定性增加的情况下,风险规避SDPG与风险中性SDPG在性能稳定性方面有何差异?
- RQ3优化CVaR是否能提升仿真到现实迁移场景中的泛化能力与可靠性?
- RQ4在高方差、高风险环境中,不同CVaR α水平如何影响期望回报与鲁棒性之间的权衡?
主要发现
- 在HalfCheetah-v2环境中,风险规避SDPG策略在α = 0.1时在所有噪声水平下均表现最佳,优于风险中性策略及其他CVaR设置。
- 在BipedalWalker-v2环境中,所有非零α值训练的策略在所有噪声水平下均持续优于风险中性策略,且随着噪声增加,性能下降速度显著减缓。
- 在Walker2d-v2环境中,α = 0.5的策略表现出最高鲁棒性,即使在高噪声(1.5×a_max)条件下仍保持稳定性能,而风险中性策略对扰动最为敏感。
- CDF分析证实,风险规避策略在低回报区域具有更重的尾部,表明在不确定性下发生灾难性失败的可能性更低。
- 所提方法在训练性能上与风险中性SDPG相当,但显著提升了推理阶段的鲁棒性,证明了有效风险感知策略学习的实现。
- 结果表明,基于CVaR的优化能有效减轻模型不确定性与执行器噪声的影响,使策略更适用于现实世界部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。