[论文解读] Variance-Reduced Off-Policy Memory-Efficient Policy Search
本文提出 VOMPS 和 ACE-STORM,这是首个结合 STORM 与强调加权演员-评论家框架(ACE/GeoffPAC)的方差减少、离策略、内存高效的策略梯度算法。通过消除对大型参考样本集的需求并实现稳定的离策略学习,该方法在收敛速度和方差方面优于以往的在线策略或内存密集型方法,实证结果表明其具有更高的样本效率和对动作噪声的鲁棒性。
Off-policy policy optimization is a challenging problem in reinforcement learning (RL). The algorithms designed for this problem often suffer from high variance in their estimators, which results in poor sample efficiency, and have issues with convergence. A few variance-reduced on-policy policy gradient algorithms have been recently proposed that use methods from stochastic optimization to reduce the variance of the gradient estimate in the REINFORCE algorithm. However, these algorithms are not designed for the off-policy setting and are memory-inefficient, since they need to collect and store a large ``reference'' batch of samples from time to time. To achieve variance-reduced off-policy-stable policy optimization, we propose an algorithm family that is memory-efficient, stochastically variance-reduced, and capable of learning from off-policy samples. Empirical studies validate the effectiveness of the proposed approaches.
研究动机与目标
- 解决离策略策略优化中的高方差与内存低效双重挑战。
- 在不存储大型参考批次的情况下,实现从离策略数据中稳定、方差减少的策略学习。
- 开发首个既收敛又内存高效的离策略方差减少策略梯度方法。
- 将 STORM 的递归动量机制与离策略演员-评论家框架(ACE/GeoffPAC)结合,实现稳定且低方差的更新。
- 在基准控制环境中验证所提算法,实现更高的样本效率和对噪声的抗性。
提出的方法
- 利用 STORM(一种避免使用固定参考批次的随机方差减少技术)实现梯度方差减少,而无需存储大型样本集。
- 将 STORM 与 ACE 和 GeoffPAC 离策略演员-评论家框架集成,以确保离策略学习的稳定性。
- 在 ACE 和 GeoffPAC 中使用强调加权机制,以校正行为策略与目标策略之间的分布偏移,提升离策略收敛性。
- 设计 VOMPS 作为方差减少的离策略策略梯度方法,ACE-STORM 作为方差减少的演员-评论家变体,两者均避免存储参考样本。
- 应用结合当前随机梯度与历史迭代动量的递归梯度更新,实现在不重新处理旧数据的前提下实现方差减少。
- 在梯度估计中使用重要性采样和离策略校正,以在从行为策略数据学习时保持稳定性。
实验结果
研究问题
- RQ1能否在不依赖大型参考样本存储的前提下,有效将随机方差减少应用于离策略策略学习?
- RQ2STORM 的递归动量机制能否与离策略演员-评论家框架结合,实现方差减少与内存效率的双重目标?
- RQ3与现有在线策略方差减少方法及离策略基线相比,所提方法在样本效率和稳定性方面表现如何?
- RQ4在离策略设置中,所提算法是否在动作噪声和分布偏移下仍保持鲁棒性?
- RQ5STORM 与强调加权机制的结合能否在连续控制任务中实现稳定、收敛且低方差的策略优化?
主要发现
- 在 CartPoleContinuous-v0 上,VOMPS 和 ACE-STORM 仅需约 20 万次样本即可达到近似最优性能,优于 SVRPG 和 SRVR-PG(分别需超过 40 万次样本)。
- 在 Hopper-v2 和 HalfCheetah-v2 上,VOMPS 和 ACE-STORM 的收敛速度更快,蒙特卡洛回报更高,且方差显著低于 SVRPG、SRVR-PG、DDPG 和 TD3。
- VOMPS 和 ACE-STORM 的学习曲线比 GeoffPAC、DDPG 和 TD3 更平滑、更稳定,表明其具有更优的收敛特性。
- 在 20% 动作噪声下,VOMPS 和 ACE-STORM 展现出优越的鲁棒性,保持稳定且高效,而其他方法性能显著下降。
- ACE-STORM 和 VOMPS 在所有测试方法中表现出最高的抗噪能力,证实了随机方差减少在真实世界扰动中的有效性。
- 所提算法是首个同时实现离策略稳定性、方差减少与内存效率的算法,在样本效率和稳定性方面优于现有在线策略方差减少方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。