Skip to main content
QUICK REVIEW

[论文解读] The Challenges of Exploration for Offline Reinforcement Learning

Nathan Lambert, Markus Wulfmeier|arXiv (Cornell University)|Jan 27, 2022
Reinforcement Learning in Robotics被引用 8
一句话总结

本文提出 Explore2Offline,一种通过使用基于好奇心的内在动机实现任务无关探索,将离线强化学习中的数据收集与策略推理解耦的框架。通过使用奖励重标记的离线强化学习评估数据质量,结果表明任务无关探索可生成对下游任务有效的数据集,所提出的内在模型预测控制(IMPC)智能体在性能上可与在线强化学习数据收集相媲美。

ABSTRACT

Offline Reinforcement Learning (ORL) enablesus to separately study the two interlinked processes of reinforcement learning: collecting informative experience and inferring optimal behaviour. The second step has been widely studied in the offline setting, but just as critical to data-efficient RL is the collection of informative data. The task-agnostic setting for data collection, where the task is not known a priori, is of particular interest due to the possibility of collecting a single dataset and using it to solve several downstream tasks as they arise. We investigate this setting via curiosity-based intrinsic motivation, a family of exploration methods which encourage the agent to explore those states or transitions it has not yet learned to model. With Explore2Offline, we propose to evaluate the quality of collected data by transferring the collected data and inferring policies with reward relabelling and standard offline RL algorithms. We evaluate a wide variety of data collection strategies, including a new exploration agent, Intrinsic Model Predictive Control (IMPC), using this scheme and demonstrate their performance on various tasks. We use this decoupled framework to strengthen intuitions about exploration and the data prerequisites for effective offline RL.

研究动机与目标

  • 研究通过任务无关探索收集的数据在下游离线强化学习中的质量。
  • 评估基于好奇心的内在探索是否能生成对解决多个未知任务有效的数据集。
  • 开发并基准测试一种新型探索智能体——内在模型预测控制(IMPC),该智能体结合了模型预测控制与内在好奇心。
  • 通过解耦框架,将强化学习中的数据收集与策略推理过程分离。
  • 为无监督数据收集下的数据效率、迁移性以及当前离线强化学习算法的局限性提供实证见解。

提出的方法

  • 提出 Explore2Offline,一种两阶段框架:首先,智能体在无任务知识的情况下使用内在奖励探索环境;其次,将收集到的经验使用任务特定奖励重标记,并用于离线强化学习。
  • 使用评论者正则化回归(CRR)作为离线强化学习算法,在从收集的回放缓冲区中重标记的数据上训练策略。
  • 提出内在模型预测控制(IMPC),结合学习到的动力学模型与单状态好奇心奖励,以指导在线规划进行探索。
  • 基于世界模型预测误差的内在好奇心奖励,以鼓励探索新状态。
  • 在相同数据集上评估多种数据收集策略(包括随机、基于好奇心、IMPC)在多个下游任务中的迁移性能。
  • 使用奖励重标记,为各种任务中的目标状态分配稀疏的+1奖励,从而评估跨任务难度递增的数据迁移性能。

实验结果

研究问题

  • RQ1通过内在好奇心实现的任务无关探索能否生成使先前未知任务的离线策略学习有效的数据集?
  • RQ2基于好奇心的智能体收集的数据训练出的策略在相同任务上的性能,与使用在线强化学习数据收集训练的策略相比如何?
  • RQ3不同数据收集策略对在不同难度任务上的下游迁移性能有何影响?
  • RQ4基于好奇心的智能体收集的数据质量与下游性能之间的相关性如何?哪些数据属性最能预测成功?
  • RQ5通过内在探索收集的单一数据集在具有不同目标状态的多个下游任务中,其泛化能力如何?

主要发现

  • 随机探索智能体收集的数据质量与基于好奇心的方法相当,表明全面探索可能已足以产生离线强化学习所需的足够数据多样性。
  • 基于好奇心的智能体收集的数据训练出的策略在训练任务上的性能与在线强化学习基线相当,证明了任务无关数据收集的可行性。
  • 内在模型预测控制(IMPC)智能体在多个下游任务中优于其他基于好奇心的方法,表明其在数据效率和探索质量方面均有提升。
  • 通过任务无关探索收集的数据表现出强大的迁移性能,尤其在更困难的迁移任务中,表明对目标错位具有鲁棒性。
  • 在任务-智能体组合之间存在显著的性能差异,表明离线强化学习算法(如 CRR)的选择与数据质量及任务结构之间存在显著交互作用。
  • 本研究强调,数据质量不仅取决于探索策略,还取决于数据属性与用于策略推理的离线强化学习算法之间的相互作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。