Skip to main content
QUICK REVIEW

[论文解读] Learning Robust Options

Daniel J. Mankowitz, Timothy Mann|arXiv (Cornell University)|Feb 9, 2018
Reinforcement Learning in Robotics被引用 15
一句话总结

该论文提出了一种新型算法——鲁棒选项策略迭代(ROPI),可在强化学习中学习对模型不确定性具有鲁棒性的时序抽象选项。通过整合鲁棒值函数更新与策略梯度,ROPI使深度Q网络(RO-DQN)能够泛化于多种动力学环境——在参数变化下,其在CartPole和Acrobot任务中的表现优于非鲁棒基线方法。

ABSTRACT

Robust reinforcement learning aims to produce policies that have strong guarantees even in the face of environments/transition models whose parameters have strong uncertainty. Existing work uses value-based methods and the usual primitive action setting. In this paper, we propose robust methods for learning temporally abstract actions, in the framework of options. We present a Robust Options Policy Iteration (ROPI) algorithm with convergence guarantees, which learns options that are robust to model uncertainty. We utilize ROPI to learn robust options with the Robust Options Deep Q Network (RO-DQN) that solves multiple tasks and mitigates model misspecification due to model uncertainty. We present experimental results which suggest that policy iteration with linear features may have an inherent form of robustness when using coarse feature representations. In addition, we present experimental results which demonstrate that robustness helps policy iteration implemented on top of deep neural networks to generalize over a much broader range of dynamics than non-robust policy iteration.

研究动机与目标

  • 解决现有选项学习方法在面对动力系统中模型不确定性时缺乏鲁棒性的问题。
  • 开发一种策略迭代框架,学习对转移模型变化具有鲁棒性的选项,例如机器人系统中不同的物理参数。
  • 证明鲁棒选项能够缓解基于特征的模型误设与深度神经网络设定下的模型不确定性。
  • 为所提出的鲁棒选项策略迭代(ROPI)算法提供理论收敛保证。
  • 实现在多任务强化学习中对多样化动力学的泛化能力,而无需进行任务特定的微调。

提出的方法

  • 提出鲁棒选项策略迭代(ROPI),一种两步算法,结合鲁棒策略评估(RPVI)与基于鲁棒策略梯度的鲁棒策略改进。
  • 集成鲁棒时序差分(TD)更新,通过在可能转移模型的模糊集上最小化最坏情况回报,确保对模型不确定性的鲁棒性。
  • 采用鲁棒兼容性条件,确保在模型扰动下值函数近似保持一致。
  • 在深度Q网络框架(RO-DQN)中实现ROPI,通过在线交替优化选项头,学习多个任务的共享表征。
  • 应用鲁棒TD误差:$\delta = Q(x,a) - r + \gamma \inf_{p \in \mathcal{P}(x,a)} \sum_{x'} p(x'|x,a) \max_{a'} Q(x',a')$ 来在模型模糊性下更新Q值。
  • 使用ADAM优化器端到端训练RO-DQN,最多3000个回合,评估在不同物理参数(如杆长、质量)下的性能。

实验结果

研究问题

  • RQ1策略迭代框架能否被扩展以学习对动力系统中模型不确定性具有鲁棒性的选项?
  • RQ2线性特征表示的粗粒度是否本质上赋予选项学习中对模型误设的鲁棒性?
  • RQ3通过ROPI学习的鲁棒选项能否提升基于深度神经网络的强化学习智能体在不同环境动力学下的泛化能力?
  • RQ4鲁棒选项在多任务强化学习中在多大程度上能缓解基于特征的模型误设与模型不确定性?
  • RQ5RO-DQN在处理CartPole和Acrobot任务中的参数变化时,与标准DQN和O-DQN相比表现如何?

主要发现

  • 非鲁棒的ASAP算法在线性设定下表现出固有的鲁棒性,这是由于粗粒度特征表示限制了对模型变化的敏感性。
  • 在深度神经网络设定下,标准DQN和O-DQN在CartPole和Acrobot任务中无法在参数变化下实现泛化,表现出振荡性能并在模型不确定性下性能退化。
  • RO-DQN成功学习了鲁棒选项,在0.5–5.0米的杆长和1.0–5.5千克的质量范围内均保持高性能,优于非鲁棒基线方法。
  • ROPI通过在不确定性集中优化最坏情况转移动力学,实现了理论保证的收敛性,即使在存在模型模糊性时亦然。
  • 鲁棒TD更新的集成显著提升了泛化能力,使单一共享网络能够在动态参数变化下解决多个任务。
  • 实验结果表明,鲁棒选项显著缩小了机器人策略迁移中的仿真到现实差距,尤其在动力学模型不完美或不确定的情况下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。