Skip to main content
QUICK REVIEW

[论文解读] CROP: Certifying Robust Policies for Reinforcement Learning through Functional Smoothing

Fan Wu, Linyi Li|arXiv (Cornell University)|Jun 17, 2021
Adversarial Robustness in Machine Learning参考文献 70被引用 4
一句话总结

CROP 首次提出一种统一框架,通过函数平滑对强化学习中的鲁棒性进行认证,引入两种认证标准:逐状态动作稳定性与累积奖励的下界。它采用局部和全局平滑算法,提供理论支持的鲁棒性保证,在多个环境和算法中实现紧密认证,包括对抗性训练和正则化强化学习方法。

ABSTRACT

As reinforcement learning (RL) has achieved great success and been even adopted in safety-critical domains such as autonomous vehicles, a range of empirical studies have been conducted to improve its robustness against adversarial attacks. However, how to certify its robustness with theoretical guarantees still remains challenging. In this paper, we present the first unified framework CROP (Certifying Robust Policies for RL) to provide robustness certification on both action and reward levels. In particular, we propose two robustness certification criteria: robustness of per-state actions and lower bound of cumulative rewards. We then develop a local smoothing algorithm for policies derived from Q-functions to guarantee the robustness of actions taken along the trajectory; we also develop a global smoothing algorithm for certifying the lower bound of a finite-horizon cumulative reward, as well as a novel local smoothing algorithm to perform adaptive search in order to obtain tighter reward certification. Empirically, we apply CROP to evaluate several existing empirically robust RL algorithms, including adversarial training and different robust regularization, in four environments (two representative Atari games, Highway, and CartPole). Furthermore, by evaluating these algorithms against adversarial attacks, we demonstrate that our certification are often tight. All experiment results are available at website https://crop-leaderboard.github.io.

研究动机与目标

  • 为解决强化学习中缺乏理论鲁棒性认证的问题,特别是针对对抗性扰动下的序列决策问题。
  • 定义超越单步预测的有意义的强化学习鲁棒性标准,重点关注动作稳定性和累积奖励的鲁棒性。
  • 开发一种可扩展的统一认证框架,为基于 Q-learning 的智能体提供动作和奖励鲁棒性的可证明保证。
  • 对现有经验上鲁棒的强化学习算法在对抗性攻击下的认证鲁棒性进行实证评估与比较。
  • 证明认证能够揭示状态空间中的脆弱性模式,并指导设计更鲁棒的策略。

提出的方法

  • 提出两种认证标准:通过局部平滑实现逐状态动作稳定性,以及通过全局和平滑方法实现有限时域累积奖励的下界。
  • 提出 CROP-GRe,一种全局平滑方法,通过在整个轨迹上使用噪声序列来估计累积奖励的期望值或分位数下界。
  • 开发 CROP-LoRe,一种自适应局部平滑算法,通过在动作空间中迭代搜索实现累积奖励的紧致下界认证。
  • 对 Q 函数应用随机平滑,推导出在扰动半径内动作保持不变的认证范围,确保状态层面的鲁棒性。
  • 采用基于随机平滑的概率认证方法,与先前工作中使用的确定性验证形成对比,从而实现更广泛的应用性和更紧致的边界。
  • 在 CROP-LoRe 中采用自适应搜索以优化累积奖励的下界,相比全局平滑方法显著提升了紧致性。

实验结果

研究问题

  • RQ1如何在有界扰动下,对强化学习中的动作和累积奖励实现形式化的鲁棒性认证?
  • RQ2在序列决策设置中,哪些有效的认证技术能够在计算效率与边界紧致性之间取得平衡?
  • RQ3现有经验上鲁棒的强化学习算法在不同环境和策略架构下的认证鲁棒性如何变化?
  • RQ4逐状态鲁棒性认证是否能揭示状态空间中周期性或结构性的脆弱性,从而为针对性防御改进提供依据?
  • RQ5与对抗性攻击下的实际性能相比,累积奖励的认证下界有多紧?

主要发现

  • CROP 是首个能够对强化学习中的累积奖励鲁棒性进行认证的框架,提出了一种新颖的下界认证方法,其紧致性优于全局平滑方法。
  • CROP-LoRe 算法在累积奖励下界认证方面显著优于 CROP-GRe,证明了自适应局部平滑的有效性。
  • 在 Freeway 环境中,RadialRL 被发现是认证鲁棒性最强的方法,凸显了认证在比较防御策略中的实用性。
  • 逐状态认证揭示了 Pong 中的周期性鲁棒性模式,表明某些状态本质上更具脆弱性,从而可指导针对性防御改进。
  • 对抗性攻击下的实证评估表明,CROP 的认证边界通常非常紧密,验证了理论保证的实际相关性。
  • 该框架成功在四个环境中对九种经验上鲁棒的强化学习算法进行了评估,表明认证鲁棒性既取决于算法设计,也受环境动态的影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。