[论文解读] Training Diverse High-Dimensional Controllers by Scaling Covariance Matrix Adaptation MAP-Annealing
本文提出了Covariance Matrix Adaptation MAP-Annealing(CMA-MAE)的可扩展变体,实现了对机器人运动中多样化、高维神经网络控制器的高效训练。通过用稀疏、高效的近似方法替代原有的二次复杂度CMA-ES,该方法在保持低超参数敏感性的同时,显著减少了训练时间,且在运动控制任务上实现了最先进的质量多样性性能,优于深度强化学习基线方法。
Pre-training a diverse set of neural network controllers in simulation has enabled robots to adapt online to damage in robot locomotion tasks. However, finding diverse, high-performing controllers requires expensive network training and extensive tuning of a large number of hyperparameters. On the other hand, Covariance Matrix Adaptation MAP-Annealing (CMA-MAE), an evolution strategies (ES)-based quality diversity algorithm, does not have these limitations and has achieved state-of-the-art performance on standard QD benchmarks. However, CMA-MAE cannot scale to modern neural network controllers due to its quadratic complexity. We leverage efficient approximation methods in ES to propose three new CMA-MAE variants that scale to high dimensions. Our experiments show that the variants outperform ES-based baselines in benchmark robotic locomotion tasks, while being comparable with or exceeding state-of-the-art deep reinforcement learning-based quality diversity algorithms.
研究动机与目标
- 解决在计算资源有限的条件下,为机器人运动控制训练多样化、高性能神经网络控制器的挑战。
- 克服CMA-MAE的二次时间复杂度,该复杂度限制了其在具有数千至数百万参数的高维控制器中的可扩展性。
- 为机器人控制开发高效、低超参数依赖的深度强化学习基质量多样性算法替代方案。
- 通过减少训练时间和计算开销,实现质量多样性算法在真实机器人系统中的实用化部署。
- 证明基于进化策略的方法可在性能上匹配或超越当前最先进的基于深度强化学习的QD算法,同时具备更高的效率与更易调参的特性。
提出的方法
- 提出三种新型CMA-MAE变体,通过使用稀疏、低秩近似替代CMA-ES中的满秩协方差矩阵,将每样本的时间复杂度从O(n²)降低至O(n)。
- 保持核心CMA-MAE框架:采用均值为φ*、近似协方差矩阵Σ̃的高斯搜索分布,并通过进化策略反馈进行更新。
- 引入带有单元特定阈值和改进反馈Δi的软存档机制,以平衡度量空间中的探索与目标优化。
- 使用单一超参数α ∈ [0,1] 控制探索与利用之间的权衡,与原始CMA-MAE类似。
- 通过仅使用函数评估高效估计自然梯度更新,避免反向传播与网络训练。
- 在模拟环境中应用于机器人运动控制任务,通过QD得分和控制器多样性指标评估性能。

实验结果
研究问题
- RQ1CMA-MAE能否扩展至现代机器人运动控制中使用的高维神经网络控制器?
- RQ2CMA-MAE变体中的稀疏协方差近似是否在降低计算复杂度的同时保持或提升性能?
- RQ3所提出的CMA-MAE变体在性能上与当前最先进的基于深度强化学习的质量多样性算法(如PGA-ME和CMA-MEGA(TD3, ES))相比如何?
- RQ4所提出的变体在实现高质量多样性的同时,能在多大程度上继承CMA-ES的低超参数敏感性?
- RQ5带有自适应学习率α的软存档机制是否能有效平衡高维控制器搜索中的探索与利用?
主要发现
- 所提出的CMA-MAE变体在标准机器人运动基准测试中全面优于所有基于进化策略的基线方法,在QD Ant、Half-Cheetah、Hopper和Walker任务中均实现了更高的QD得分。
- 在四个任务中的三个(QD Ant、Half-Cheetah、Hopper)中,变体的性能达到或超过当前最先进的基于深度强化学习的PGA-ME算法,Half-Cheetah任务的QD得分最高达2.939×10⁶。
- 与PGA-ME和CMA-MEGA(TD3, ES)相比,变体的运行时间显著缩短,加速超过2倍,主要得益于避免了深度强化学习的训练循环。
- 消融研究证实,中等α值(如α=0.001)可实现最佳性能,而极端值(α=0或α=1)会因仅聚焦于探索或利用而导致性能下降。
- 所有方法中内存使用主要由存档模块主导,但CMA-MAE变体因无需经验回放缓冲区,相比TD3基方法内存占用更低。
- 变体保持了低超参数敏感性,仅需五个参数(ψ, λ, σ, α, min_f),而基于深度强化学习的方法通常需要15–18个参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。