[论文解读] Robust Policy Gradient against Strong Data Corruption
该论文提出了一种鲁棒强化学习算法——过滤策略梯度(Filtered Policy Gradient, FPG),在强数据污染条件下,即奖励和转移过程均存在高达 $\varepsilon$ 分数的对抗性污染时,实现了 $O(\varepsilon^{1/4})$-最优策略。FPG 在自然策略梯度框架中引入过滤机制,以缓解奖励污染无界的问题,其性能优于先前在线性污染预算下失效的方法。
We study the problem of robust reinforcement learning under adversarial corruption on both rewards and transitions. Our attack model assumes an extit{adaptive} adversary who can arbitrarily corrupt the reward and transition at every step within an episode, for at most $ε$-fraction of the learning episodes. Our attack model is strictly stronger than those considered in prior works. Our first result shows that no algorithm can find a better than $O(ε)$-optimal policy under our attack model. Next, we show that surprisingly the natural policy gradient (NPG) method retains a natural robustness property if the reward corruption is bounded, and can find an $O(\sqrtε)$-optimal policy. Consequently, we develop a Filtered Policy Gradient (FPG) algorithm that can tolerate even unbounded reward corruption and can find an $O(ε^{1/4})$-optimal policy. We emphasize that FPG is the first that can achieve a meaningful learning guarantee when a constant fraction of episodes are corrupted. Complimentary to the theoretical results, we show that a neural implementation of FPG achieves strong robust learning performance on the MuJoCo continuous control benchmarks.
研究动机与目标
- 解决在奖励和转移过程均遭受强自适应数据污染时,策略梯度方法缺乏鲁棒性的问题。
- 开发一种即使在恒定比例的轨迹被污染时仍有效的算法,这一场景下先前的方法已失效。
- 在不依赖污染程度 $\varepsilon$ 知识的前提下,为在有界和无界奖励污染下的鲁棒性提供理论保证。
- 通过在 MuJoCo 基准上的神经网络实现,展示算法的实际适用性。
提出的方法
- 提出一种过滤策略梯度(FPG)算法,在策略梯度更新过程中应用过滤机制以剔除污染数据。
- 使用 $d_{\nu}^{\pi}$-采样器和 $Q^{\pi}$-估计器,在策略 $\pi$ 下收集状态-动作对和回报估计值,即使在对抗性劫持下也能保持有效。
- 通过线性回归估计价值函数梯度,对权重向量 $w$ 施加有界 $\ell_2$-范数约束。
- 引入过滤步骤,在回归阶段识别并排除污染的轨迹,从而提升对无界奖励污染的鲁棒性。
- 采用学习率 $\eta$ 的自然策略梯度更新,更新规则为 $\theta^{(t+1)} = \theta^{(t)} + \eta w^{(t)}$。
- 确保算法对污染程度 $\varepsilon$ 具有自适应性,且无需事先知晓 $\varepsilon$。
实验结果
研究问题
- RQ1在奖励和转移过程均遭受强自适应污染的条件下,是否存在算法能够实现优于 $O(\varepsilon)$-最优策略?
- RQ2自然策略梯度(NPG)方法在有界奖励污染下是否仍保持鲁棒性?若然,其鲁棒程度如何?
- RQ3能否设计一种改进的策略梯度方法,以容忍无界奖励污染,同时仍能实现有意义的性能保证?
- RQ4是否可能设计一种实际可行、兼容神经网络的算法,在连续控制环境中保持高污染率下的鲁棒性?
主要发现
- 在所提出的强污染模型下,任何算法都无法保证优于 $\Omega(\varepsilon)$-最优策略,从而确立了理论下界。
- 自然策略梯度(NPG)在有界奖励污染下实现了 $O(\sqrt{\varepsilon})$-最优性,展现出内在鲁棒性。
- 所提出的过滤策略梯度(FPG)算法在无界奖励污染下实现了 $O(\varepsilon^{1/4})$-最优性,这是首个针对常数比例污染的此类保证。
- FPG 对污染程度具有自适应性,且无需事先知晓 $\varepsilon$,使其适用于实际部署。
- FPG 的神经网络实现版本在 MuJoCo 连续控制基准上实现了强大的鲁棒学习性能,验证了其实际可行性。
- 理论分析表明,在有界污染下,Q值回归的估计误差保持有界,从而可保证收敛至近似最优策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。