Skip to main content
QUICK REVIEW

[论文解读] Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning

Thang Doan, Bogdan Mazoure|arXiv (Cornell University)|Sep 17, 2019
Reinforcement Learning in Robotics参考文献 30被引用 8
一句话总结

该论文提出了一种基于种群的强化学习方法——吸引力-排斥力演员-critic(ARAC),用于连续控制任务。该方法利用归一化流(normalizing flows, NF)实现策略间的成对吸引力与排斥力,从而实现结构化的探索。通过在NF参数化策略上计算KL散度,ARAC在MuJoCo基准测试中实现了更优的样本效率和性能表现,尤其在具有欺骗性、高维的双足环境任务中,其表现优于SAC及其他基线方法。

ABSTRACT

Continuous control tasks in reinforcement learning are important because they provide an important framework for learning in high-dimensional state spaces with deceptive rewards, where the agent can easily become trapped into suboptimal solutions. One way to avoid local optima is to use a population of agents to ensure coverage of the policy space, yet learning a population with the "best" coverage is still an open problem. In this work, we present a novel approach to population-based RL in continuous control that leverages properties of normalizing flows to perform attractive and repulsive operations between current members of the population and previously observed policies. Empirical results on the MuJoCo suite demonstrate a high performance gain for our algorithm compared to prior work, including Soft-Actor Critic (SAC).

研究动机与目标

  • 为解决连续控制强化学习中局部最优解的问题,尤其是在高维、多模态奖励景观下的挑战。
  • 改善密集奖励环境(如MuJoCo)中的探索能力,因为标准算法可能因欺骗性动力学而收敛至次优策略。
  • 通过在策略空间而非参数空间中施加吸引力与排斥力,增强基于种群的探索多样性。
  • 利用归一化流构建更具表现力且稳定的策略表示,以支持有效的基于KL散度的差异度量计算。
  • 证明ARAC在复杂运动控制任务中,相较于单智能体方法及先前的种群基方法,能够实现更快的收敛速度与更高的性能表现。

提出的方法

  • 该方法采用一组智能体,每个智能体的策略由归一化流(NF)参数化,从而支持灵活的非高斯策略分布,并具备可计算的密度估计能力。
  • 引入一种吸引力-排斥力(AR)损失,利用策略间的KL散度来促进多样性:对相似策略施加排斥力,对高性能祖先策略施加吸引力。
  • 将AR目标整合进Soft Actor-Critic(SAC)框架中,引入超参数λ以控制排斥力的强度。
  • 采用双模态存档(bi-modal archive)存储高性能且多样化的策略,从中采样祖先策略以指导吸引力,确保长期的策略覆盖。
  • KL散度在NF策略之间计算,从而实现稳定且具表现力的排斥力,避免了高斯策略中常见的方差坍缩与均值发散问题。
  • 整体损失函数结合了SAC的标准目标与AR损失,实现性能与多样性的联合优化。

实验结果

研究问题

  • RQ1在策略空间中引入吸引力-排斥力机制,是否能改善连续控制强化学习中的探索与泛化能力?
  • RQ2相较于高斯策略,使用归一化流是否能带来更稳定、更有效的吸引力-排斥力动态?
  • RQ3在MuJoCo运动控制任务中,ARAC相较于SAC及其他种群基方法,在样本效率与最终性能方面表现如何?
  • RQ4ARAC是否能在标准算法失效的稀疏奖励环境中成功学习?
  • RQ5AR机制是否能实现对动作空间的更好覆盖,并避免策略陷入纠缠、冗余的状态?

主要发现

  • ARAC在所有MuJoCo连续控制任务中均优于Soft Actor-Critic(SAC)及其他基线方法,实现了更高的最终性能与更快的收敛速度。
  • 在Ant-v2与Humanoid-v2环境中,ARAC仅用100万次环境交互步数,便分别达到6,000与4,000的累积回报,而单个SAC智能体则分别需要400万与300万步才能达到该水平。
  • 在稀疏奖励的SparseHumanoid-v2环境中,ARAC是唯一实现非零性能的方法,展现出对稀疏奖励的强鲁棒性。
  • 消融实验表明,当排斥力缺失(λ=0)时,智能体的动作在动作空间中发生纠缠;而当λ>0时,各智能体探索不同区域,证实了多样性机制的有效性。
  • 相较于高斯策略,使用NF策略可有效防止排斥过程中出现的方差坍缩与均值发散,从而实现更稳定、更高效的探索。
  • t-SNE可视化结果表明,NF策略下的排斥力能更有效地分离不同智能体的动作分布,而高斯策略则难以维持策略多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。