[论文解读] Robust Reinforcement Learning with Wasserstein Constraint
本文提出了一种Wasserstein约束的鲁棒强化学习框架,通过在参考转移核周围构建Wasserstein球来建模环境动态的不确定性,将无限维的鲁棒MDP转化为有限维的风险感知问题。通过利用Wasserstein距离的强对偶性,建立了转移核扰动与状态级扰动之间的联系,从而设计出一种新型的WRAAC算法,实现了无需环境表征的理论基础鲁棒性,在Cart-Pole环境中通过动态扰动下的性能提升得到了验证。
Robust Reinforcement Learning aims to find the optimal policy with some extent of robustness to environmental dynamics. Existing learning algorithms usually enable the robustness through disturbing the current state or simulating environmental parameters in a heuristic way, which lack quantified robustness to the system dynamics (i.e. transition probability). To overcome this issue, we leverage Wasserstein distance to measure the disturbance to the reference transition kernel. With Wasserstein distance, we are able to connect transition kernel disturbance to the state disturbance, i.e. reduce an infinite-dimensional optimization problem to a finite-dimensional risk-aware problem. Through the derived risk-aware optimal Bellman equation, we show the existence of optimal robust policies, provide a sensitivity analysis for the perturbations, and then design a novel robust learning algorithm--Wasserstein Robust Advantage Actor-Critic algorithm (WRAAC). The effectiveness of the proposed algorithm is verified in the Cart-Pole environment.
研究动机与目标
- 解决现有启发式鲁棒强化学习方法在扰动状态或参数时缺乏理论鲁棒性保证的问题。
- 提出一种基于Wasserstein距离的系统性框架,以量化对转移概率动态的鲁棒性。
- 通过强对偶性,将无限维的鲁棒MDP问题转化为可处理的有限维风险感知MDP。
- 设计一种数据驱动、环境无关的鲁棒强化学习算法,无需事先了解环境参数。
- 在Cart-Pole环境中通过真实世界类似的动态扰动,验证所提方法的有效性与鲁棒性。
提出的方法
- 定义以参考转移核为中心的基于Wasserstein的不确定性集,以约束可接受的动力学扰动。
- 应用Wasserstein距离的强对偶性,将鲁棒MDP重述为风险感知MDP,建立转移核扰动与状态级扰动之间的联系。
- 推导出一种修正的鲁棒Bellman方程,以支持对最优策略及其对扰动敏感性的理论分析。
- 提出WRAAC算法,一种两阶段的演员-评论家方法,通过风险感知优势估计在价值函数和策略更新之间交替进行。
- 采用对偶变量学习机制来估计Wasserstein约束,其中λ和z根据每个状态转移的模拟动态进行初始化。
- 使用独立的学习率对价值网络和策略网络进行随机梯度更新,实现策略的端到端训练。
实验结果
研究问题
- RQ1Wasserstein距离能否用于在强化学习中正式量化对转移概率动态的鲁棒性?
- RQ2如何利用对偶性将无限维的鲁棒MDP问题简化为有限维、可处理的风险感知MDP?
- RQ3所提方法是否能在不依赖系统参数先验知识的情况下实现对环境动态的鲁棒性?
- RQ4最优策略对Wasserstein不确定性集半径δ的敏感性如何?
- RQ5WRAAC算法在真实世界类似环境的动态扰动下,是否能比标准A2C更好地泛化?
主要发现
- 在施加力的幅度为100单位的扰动下,WRAAC算法相比标准A2C显著提升了鲁棒性,维持了更长的杆子存活时间。
- 在小扰动下,基线A2C策略与WRAAC表现相当,表明鲁棒性并未以名义条件下的性能为代价。
- 当杆质量超过1.25时,鲁棒策略仍能保持稳定性能,而两种策略均急剧下降,表明存在难以被线性扰动捕捉的突发动态变化。
- 实验结果证实,WRAAC学习到了对环境动态的真实鲁棒性,表现为在不同动态条件下性能的一致性。
- 环境参数的选择(如施加力的大小与杆质量)显著影响动态扰动的平滑性,其中施加力大小能提供更可预测的鲁棒性评估。
- WRAAC算法通过在无需显式环境表征或先验参数知识的前提下实现鲁棒性,展现出理论与实证优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。