Skip to main content
QUICK REVIEW

[论文解读] An Alternative to Variance: Gini Deviation for Risk-averse Policy Gradient

Yudong Luo, Guiliang Liu|arXiv (Cornell University)|Jul 17, 2023
Health Systems, Economic Evaluations, Quality of LifeEconomics, Econometrics and Finance被引用 3
一句话总结

本文提出基尼离差(Gini deviation, GD)作为风险规避策略梯度强化学习中方差的更优替代方案。通过从GD的分位数表示推导出策略梯度算法,该方法在获得更高回报的同时实现更低风险——在学习稳定性和鲁棒性方面优于基于方差的方法,尤其在基于方差的方法无法收敛的领域表现更优。

ABSTRACT

Restricting the variance of a policy's return is a popular choice in risk-averse Reinforcement Learning (RL) due to its clear mathematical definition and easy interpretability. Traditional methods directly restrict the total return variance. Recent methods restrict the per-step reward variance as a proxy. We thoroughly examine the limitations of these variance-based methods, such as sensitivity to numerical scale and hindering of policy learning, and propose to use an alternative risk measure, Gini deviation, as a substitute. We study various properties of this new risk measure and derive a policy gradient algorithm to minimize it. Empirical evaluation in domains where risk-aversion can be clearly defined, shows that our algorithm can mitigate the limitations of variance-based risk measures and achieves high return with low risk in terms of variance and Gini deviation when others fail to learn a reasonable policy.

研究动机与目标

  • 为解决基于方差的风险度量在均值-方差强化学习中的局限性,例如对奖励缩放敏感以及干扰策略学习的问题。
  • 提出基尼离差(GD)作为更具鲁棒性的离散度度量,更好地捕捉风险而不扭曲奖励信号。
  • 开发一种实用的策略梯度算法,通过基于分位数的梯度估计器最小化GD。
  • 通过实证验证,GD-based学习在具有挑战性的环境中实现比基于方差的方法更高的回报与更低风险。
  • 在基于方差的方法无法学习稳定策略的风险规避领域中,证明该方法的优越性。

提出的方法

  • 提出基尼离差(GD)作为新的风险度量,利用基尼平均差量化回报的离散度,相较于方差具有更好的可解释性和鲁棒性。
  • 从GD的分位数表示推导出策略梯度更新,实现可微优化,避免了双采样或复杂奖励修改的需要。
  • 使用基于采样的估计器计算GD的梯度,支持与标准异策略或同策略强化学习框架的端到端训练。
  • 在策略梯度框架中应用GD最小化目标,保持与标准强化学习相同的策略架构和训练流程,但增加一个风险正则化项。
  • 采用改进的策略更新规则,平衡期望回报与GD,使用超参数控制风险规避的权衡。
  • 在MuJoCo、Lunar Lander及自定义风险规避环境中验证该方法,与基于方差和风险中性基线进行比较。

实验结果

研究问题

  • RQ1基尼离差能否在均值-方差强化学习中作为比方差更稳健、更有效的风险度量?
  • RQ2与基于方差的方法相比,使用GD是否能提升风险规避强化学习设置下的策略学习稳定性和收敛性?
  • RQ3在回报和风险(以方差和GD衡量)方面,所提出的基于GD的策略梯度方法相较于基于方差的方法表现如何?
  • RQ4在基于方差的方法无法学习的环境中,基于GD的方法是否仍能发现高回报、低风险的策略?
  • RQ5与基于方差的方法相比,基于GD的方法对奖励缩放和奖励设计的敏感性如何?

主要发现

  • 所提出的基于基尼离差的方法在基于方差的方法无法收敛或产生不稳定行为的环境中,成功学习到风险规避策略。
  • 在基于位置的风险领域(如Guarded Maze),该方法在访问噪声区域的频率上更低(例如10% vs. 20%的基于方差方法),同时保持更高的期望回报。
  • 在基于距离的风险领域(如带衰减噪声奖励的HalfCheetah和Swimmer),只有基于GD的方法(MG)表现出一致的前进运动趋势,表明其具备更优的风险感知行为。
  • 当其他方法无法学习到合理策略时,基于GD的方法相比风险中性或基于方差的基线,实现了显著更高的回报与更低的风险(以方差和基尼离差衡量)。
  • 在所有评估环境中,基于GD的方法相较于基于方差的方法,表现出更低的回报方差和基尼离差,尤其在复杂的MuJoCo任务中表现更优。
  • 该方法对奖励缩放具有鲁棒性,并避免了基于方差方法中奖励修改策略导致的策略退化问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。