Skip to main content
QUICK REVIEW

[论文解读] RORL: Robust Offline Reinforcement Learning via Conservative Smoothing

Rui Yang, Chenjia Bai|arXiv (Cornell University)|Jun 6, 2022
Adversarial Robustness in Machine Learning被引用 10
一句话总结

RORL 提出了一种用于离线强化学习的新型保守平滑技术,可在保持价值函数保守性的同时增强对观测扰动的鲁棒性。通过在数据集分布附近的策略和价值函数上应用平滑正则化,并对分布外状态使用悲观值估计,RORL 在 D4RL 基准上实现了最先进性能,并在对抗性攻击下表现出更强的鲁棒性,且在线性 MDP 中具有更紧的理论次优性界。

ABSTRACT

Offline reinforcement learning (RL) provides a promising direction to exploit massive amount of offline data for complex decision-making tasks. Due to the distribution shift issue, current offline RL algorithms are generally designed to be conservative in value estimation and action selection. However, such conservatism can impair the robustness of learned policies when encountering observation deviation under realistic conditions, such as sensor errors and adversarial attacks. To trade off robustness and conservatism, we propose Robust Offline Reinforcement Learning (RORL) with a novel conservative smoothing technique. In RORL, we explicitly introduce regularization on the policy and the value function for states near the dataset, as well as additional conservative value estimation on these states. Theoretically, we show RORL enjoys a tighter suboptimality bound than recent theoretical results in linear MDPs. We demonstrate that RORL can achieve state-of-the-art performance on the general offline RL benchmark and is considerably robust to adversarial observation perturbations.

研究动机与目标

  • 解决现有保守离线强化学习方法在传感器噪声或对抗性攻击等观测扰动下的鲁棒性不足问题。
  • 克服在分布外状态的值函数和策略学习中保守性与平滑性之间的权衡。
  • 开发一种方法,在保持分布外动作低过度估计的同时,确保在小观测偏差下的策略稳定性。
  • 提供一个理论基础坚实的不确定性度量,其在线性 MDP 中的次优性界比先前工作更紧。
  • 在标准离线强化学习基准和对抗性评估设置下,展示性能与鲁棒性的提升。

提出的方法

  • 在靠近数据集支持区域的策略和值函数上引入平滑正则化项,以提升对小观测扰动的鲁棒性。
  • 对分布外状态应用通过悲观自举的保守值估计,以防止过度估计。
  • 采用一种新颖的保守平滑技术,结合策略平滑与值函数平滑,并引入分布外感知正则化。
  • 集成一个多组件损失函数,平衡分布外值惩罚、策略平滑与 Q 函数平滑,并通过超参数调优以实现鲁棒性。
  • 利用集成 Q 网络并结合自适应平滑尺度,以降低计算成本,同时保持性能。
  • 理论分析表明,RORL 在线性 MDP 中的次优性界比先前工作更紧,验证了其保守且平滑的学习目标。

实验结果

研究问题

  • RQ1能否在不牺牲性能的前提下,使保守离线强化学习方法对观测中的小对抗扰动具有鲁棒性?
  • RQ2在数据集分布附近显式平滑策略和值函数是否能在保持保守性的同时提升鲁棒性?
  • RQ3统一的正则化框架能否比现有方法更有效地在平滑性与分布外状态的过度估计之间实现权衡?
  • RQ4RORL 在标准离线强化学习基准上,无论在干净还是扰动评估条件下,是否均展现出更好的泛化性与鲁棒性?
  • RQ5RORL 的保守平滑在次优性界方面相较于线性 MDP 中的先前工作有何理论优势?

主要发现

  • RORL 在 D4RL 基准上实现了最先进性能,优于包括 EDAC 和 SAC-10 等基于集成的基线方法。
  • 在 AntMaze 任务中,RORL 在 antmaze-umaze 上取得 96.7 ± 1.9 的性能,在 antmaze-umaze-diverse 上为 90.7 ± 2.9,在 antmaze-medium-play 上为 76.3 ± 2.5,优于 IQL+smoothing 和 CQL。
  • 在扰动幅度高达 0.05 的对抗性攻击下,RORL 在六个连续控制任务中均保持最高性能,优于 EDAC 和 SAC-10,后两者在扰动下性能下降更快。
  • RORL 在基准评估中表现出卓越的鲁棒性,其性能在各种攻击类型和尺度下均保持稳定,表明其具有强大的实际应用潜力。
  • 理论分析确认,RORL 在线性 MDP 中的次优性界比先前工作(如 Bai et al., 2021)更紧,验证了其保守且平滑的学习目标。
  • 消融研究显示,分布外损失和策略平滑损失最为关键,而 Q 平滑贡献较小但增加计算成本,提示应采用高效调优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。