Skip to main content
QUICK REVIEW

[论文解读] Risk Averse Robust Adversarial Reinforcement Learning

Xinlei Pan, Daniel Seita|arXiv (Cornell University)|Mar 31, 2019
Adversarial Robustness in Machine Learning参考文献 42被引用 11
一句话总结

该论文提出风险规避鲁棒对抗强化学习(RARARL),通过使用Q网络集合估计值函数方差,训练风险规避的主角与风险寻求的对手,使智能体能够避免灾难性结果。与标准DQN和RARL相比,该方法在对抗攻击下显著减少了自动驾驶模拟中的碰撞次数。

ABSTRACT

Deep reinforcement learning has recently made significant progress in solving computer games and robotic control tasks. A known problem, though, is that policies overfit to the training environment and may not avoid rare, catastrophic events such as automotive accidents. A classical technique for improving the robustness of reinforcement learning algorithms is to train on a set of randomized environments, but this approach only guards against common situations. Recently, robust adversarial reinforcement learning (RARL) was developed, which allows efficient applications of random and systematic perturbations by a trained adversary. A limitation of RARL is that only the expected control objective is optimized; there is no explicit modeling or optimization of risk. Thus the agents do not consider the probability of catastrophic events (i.e., those inducing abnormally large negative reward), except through their effect on the expected objective. In this paper we introduce risk-averse robust adversarial reinforcement learning (RARARL), using a risk-averse protagonist and a risk-seeking adversary. We test our approach on a self-driving vehicle controller. We use an ensemble of policy networks to model risk as the variance of value functions. We show through experiments that a risk-averse agent is better equipped to handle a risk-seeking adversary, and experiences substantially fewer crashes compared to agents trained without an adversary.

研究动机与目标

  • 解决现有鲁棒强化学习方法未能显式建模或优化罕见灾难性事件的局限性。
  • 通过在训练目标中显式引入风险规避,提升自动驾驶等安全关键环境中的策略鲁棒性。
  • 设计一种更具有效性的对手,主动寻找高风险、灾难性结果,而非依赖随机扰动。
  • 通过与风险寻求型对手的交互,使主角学习到鲁棒策略,从而探索危险状态区域。
  • 证明与随机扰动或无扰动相比,结合对抗扰动的风险规避训练能显著减少碰撞次数。

提出的方法

  • 主角采用风险规避目标,最大化期望回报的同时最小化值函数方差,方差通过Q值网络集合估计。
  • 对手被训练以最小化主角的长期回报,且明确具有风险寻求特性,专注于诱发灾难性结果。
  • 该框架采用轮换动作机制,对手每隔10步(1 in 10 steps)行动一次,对环境状态施加扰动,从而更深入探索危险动力学。
  • 采用一种新颖的非对称奖励函数:成功获得小的正奖励,灾难事件则获得大的负奖励,以强化风险规避倾向。
  • 该方法在TORCS自动驾驶模拟器中进行评估,比较无扰动、随机扰动和训练后的对抗扰动下的性能表现。
  • 基于集合的方差估计使高维连续状态空间中的可扩展风险建模成为可能,克服了先前方法假设有限状态空间的局限。

实验结果

研究问题

  • RQ1风险规避目标能否提升强化学习在罕见灾难性事件下的鲁棒性?
  • RQ2与随机扰动相比,风险寻求型对手能否为训练风险规避策略提供更强的训练信号?
  • RQ3通过Q网络集合实现的基于方差的风险建模如何提升安全关键环境中的策略泛化能力?
  • RQ4与标准DQN和RARL相比,RARARL在自动驾驶模拟中能将碰撞率降低到何种程度?
  • RQ5风险规避与对抗训练的结合是否能在模拟到现实的迁移场景中产生更可靠的策略?

主要发现

  • 使用训练后对手进行训练的风险规避DQN智能体(BSDQN-adv-riskaverse)获得灾难性事件奖励为-0.08,显著优于标准DQN(-0.80)和基于RARL的模型。
  • 在对抗扰动下,风险规避模型的最佳灾难性事件奖励为-0.10,而无风险规避的BSDQN-adv模型为-1.0,表明碰撞次数显著减少。
  • 训练后的对手成功在可视化轨迹中迫使主角撞上墙壁,而随机扰动因缺乏有目的的协调行动,无法诱发此类碰撞。
  • 与仅使用随机扰动训练的模型相比,使用对抗扰动训练的模型在随机攻击和对抗攻击下均表现出更优的鲁棒性。
  • 风险项促使对手探索高方差、高风险区域,同时促使主角避开这些区域,从而实现更安全的策略学习。
  • 基于集合的方差估计使连续高维状态空间中的有效风险建模成为可能,使该方法适用于实际应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。