[论文解读] Provably Robust Blackbox Optimization for Reinforcement Learning
本文提出鲁棒黑箱优化(RBO),一种可证明鲁棒的无导数优化方法,适用于强化学习,通过鲁棒回归与离策略梯度估计,在高达23%的函数评估值被任意破坏的情况下仍能实现高精度。RBO使在噪声环境中有效进行策略学习成为可能,而传统方法在此类环境中会失效。
Interest in derivative-free optimization (DFO) and "evolutionary strategies" (ES) has recently surged in the Reinforcement Learning (RL) community, with growing evidence that they can match state of the art methods for policy optimization problems in Robotics. However, it is well known that DFO methods suffer from prohibitively high sampling complexity. They can also be very sensitive to noisy rewards and stochastic dynamics. In this paper, we propose a new class of algorithms, called Robust Blackbox Optimization (RBO). Remarkably, even if up to $23\%$ of all the measurements are arbitrarily corrupted, RBO can provably recover gradients to high accuracy. RBO relies on learning gradient flows using robust regression methods to enable off-policy updates. On several MuJoCo robot control tasks, when all other RL approaches collapse in the presence of adversarial noise, RBO is able to train policies effectively. We also show that RBO can be applied to legged locomotion tasks including path tracking for quadruped robots.
研究动机与目标
- 解决无导数优化(DFO)与进化策略(ES)在强化学习中面临的高采样复杂度与对噪声敏感的问题。
- 克服现有黑箱优化方法在机器人中常见的噪声奖励与随机动力学下的脆弱性。
- 开发一种即使在大量测量值被对抗性破坏的情况下仍能保持高性能的方法。
- 通过重用历史样本与鲁棒回归技术,实现高效、离策略的梯度估计。
- 在MuJoCo基准任务与真实世界四足行走控制任务中,验证所提方法的有效性。
提出的方法
- 通过高斯平滑与矩阵值核,将梯度估计建模为正则化回归问题,以插值梯度场。
- 通过重用历史轨迹实现离策略学习,以估计连续的局部梯度场,降低采样复杂度。
- 利用LP解码进行鲁棒回归,即使在函数评估值中存在高达23%的任意破坏,也能准确重构梯度。
- 应用压缩感知与纠错码原理,确保在测量值中存在对抗性噪声时具有可证明的鲁棒性。
- 采用核化回归框架并引入正则化,以在噪声环境下稳定估计。
- 将鲁棒梯度估计器集成到进化策略框架中,用于强化学习中的策略优化。
实验结果
研究问题
- RQ1在高达23%的函数评估值被任意破坏的情况下,无导数优化方法能否在强化学习中保持高性能?
- RQ2历史轨迹的离策略重用在黑箱优化策略学习中如何提升采样效率?
- RQ3像LP解码这样的鲁棒回归技术在对抗性噪声下能在多大程度上确保准确的梯度估计?
- RQ4所提方法在嘈杂的MuJoCo任务与真实世界四足任务中是否优于最先进的ES与策略梯度算法?
- RQ5RBO能否在具有固有噪声奖励信号的真实世界机器人应用中实现稳定的策略训练?
主要发现
- 当20%的奖励显著被破坏时,RBO在全部8个MuJoCo任务上均成功训练了策略,而AR、TRPO与PPO等其他方法失败或获得负奖励。
- 在HalfCheetah(Linear)任务中,RBO在20万次轨迹后达到中位回报4220,AR达到4205,而TRPO与PPO完全失败(报告为-Inf)。
- 在Swimmer环境中,RBO达到360的中位回报,而TRPO与PPO分别仅达到32与30,AR则未能学习。
- 在Walker2d任务中,RBO在200万次轨迹后达到2230的中位回报,优于AR(172)、TRPO(996)与PPO(312)。
- 在Humanoid任务中,RBO达到4865的中位回报,显著优于AR(2355)、TRPO(2028)与PPO(2129),即使在20%噪声下仍表现优异。
- 在四足行走任务(Minitaur)中,RBO在25%测量值存在噪声时仍保持强劲性能,优于AR在前向行走与路径跟踪任务中的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。