Skip to main content
QUICK REVIEW

[论文解读] Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion

Bo Zhou, Hongsheng Zeng|arXiv (Cornell University)|Dec 10, 2019
Reinforcement Learning in Robotics参考文献 35被引用 6
一句话总结

该论文提出风险规避价值扩展(RAVE),一种混合强化学习方法,通过使用概率动力学模型集合来建模不确定性,并采用动态置信下界(CLB)以减少过估计并提高鲁棒性,从而增强基于模型的价值扩展。RAVE在NeurIPS 2019年‘Learn to Move’挑战赛中取得第一名,领先第二名方法144分。

ABSTRACT

By integrating dynamics models into model-free reinforcement learning (RL) methods, model-based value expansion (MVE) algorithms have shown a significant advantage in sample efficiency as well as value estimation. However, these methods suffer from higher function approximation errors than model-free methods in stochastic environments due to a lack of modeling the environmental randomness. As a result, their performance lags behind the best model-free algorithms in some challenging scenarios. In this paper, we propose a novel Hybrid-RL method that builds on MVE, namely the Risk Averse Value Expansion (RAVE). With imaginative rollouts generated by an ensemble of probabilistic dynamics models, we further introduce the aversion of risks by seeking the lower confidence bound of the estimation. Experiments on a range of challenging environments show that by modeling the uncertainty completely, RAVE substantially enhances the robustness of previous model-based methods, and yields state-of-the-art performance. With this technique, our solution gets the first place in NeurIPS 2019: Learn to Move.

研究动机与目标

  • 解决基于模型的强化学习在随机环境中鲁棒性差和函数逼近误差高的问题。
  • 通过将不确定性建模整合到基于模型和混合的强化学习框架中,提升样本效率和价值估计精度。
  • 通过风险规避的置信区间减少价值函数学习中的过估计偏差。
  • 通过动态调整价值估计中的置信下界,平衡探索与利用。
  • 在具有挑战性且高风险的强化学习环境中实现最先进性能,包括NeurIPS 2019年‘Learn to Move’挑战赛。

提出的方法

  • RAVE通过使用概率动力学模型集合扩展基于模型的价值扩展(MVE),以捕捉环境转移中的认知不确定性(aleatoric)和认知不确定性(epistemic)。
  • 它利用概率模型集合生成想象的轨迹,以预测未来回报和价值函数。
  • 该方法对预测的价值分布应用α-置信下界(α-CLB),偏好保守、风险规避的价值估计,避免过度乐观的动作选择。
  • 在训练过程中动态调整α参数,以平衡风险规避与探索,提升学习稳定性和收敛性。
  • 价值函数目标被计算为集合预测的置信下界,降低方差并提升泛化能力。
  • 该方法在推理阶段保持计算效率,仅使用训练好的策略,与基线方法相比训练时间仅略有增加。

实验结果

研究问题

  • RQ1在环境动力学中同时建模认知不确定性与认知不确定性是否能提升基于模型的价值扩展在随机环境中的鲁棒性?
  • RQ2在高风险强化学习任务中,对价值预测使用置信下界是否能减少过估计并提升策略性能?
  • RQ3置信下界参数α的动态调整如何影响学习稳定性和样本效率?
  • RQ4结合基于模型的轨迹与风险规避价值估计的混合强化学习方法是否能超越最先进模型自由和混合基线方法?
  • RQ5在现实世界中高风险控制任务(如‘Learn to Move’挑战赛)中,感知不确定性的价值估计在多大程度上提升了性能?

主要发现

  • RAVE在NeurIPS 2019年‘Learn to Move’挑战赛中获得第一名,领先第二名方法144分。
  • 在Hopper-v1环境中,与DDPG和STEVE相比,RAVE的预测Q值与真实值具有显著更好的对齐性,且过估计现象更少。
  • RAVE的动态α-CLB变体相比固定α设置实现了更快的收敛速度和更稳定的性能,有效平衡了探索与风险规避。
  • 在LearnToRun环境中,RAVE将智能体跌倒率降低至1.3%,而DDPG为15%,展现出显著更高的鲁棒性。
  • 与STEVE相比,RAVE的训练成本仅增加24.29%,而推理成本与标准模型自由方法保持一致。
  • 使用概率集成模型显著提升了价值估计精度,能够同时捕捉环境随机性(认知不确定性)和模型不确定性(认知不确定性)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。