Skip to main content
QUICK REVIEW

[论文解读] Can Wikipedia Help Offline Reinforcement Learning?

Machel Reid, Yutaro Yamada|arXiv (Cornell University)|Jan 28, 2022
Reinforcement Learning in Robotics被引用 6
一句话总结

本文提出通过将强化学习(RL)建模为序列建模,对预训练语言模型(如GPT2和基于维基百科训练的ChibiT)进行微调,以实现离线强化学习。该方法在D4RL Gym和Atari基准测试中实现了3-6倍的训练加速和最先进(SOTA)性能,证明了从自然语言预训练到强化学习任务的强大迁移能力。

ABSTRACT

Fine-tuning reinforcement learning (RL) models has been challenging because of a lack of large scale off-the-shelf datasets as well as high variance in transferability among different environments. Recent work has looked at tackling offline RL from the perspective of sequence modeling with improved results as result of the introduction of the Transformer architecture. However, when the model is trained from scratch, it suffers from slow convergence speeds. In this paper, we look to take advantage of this formulation of reinforcement learning as sequence modeling and investigate the transferability of pre-trained sequence models on other domains (vision, language) when finetuned on offline RL tasks (control, games). To this end, we also propose techniques to improve transfer between these domains. Results show consistent performance gains in terms of both convergence speed and reward on a variety of environments, accelerating training by 3-6x and achieving state-of-the-art performance in a variety of tasks using Wikipedia-pretrained and GPT2 language models. We hope that this work not only brings light to the potentials of leveraging generic sequence modeling techniques and pre-trained models for RL, but also inspires future work on sharing knowledge between generative modeling tasks of completely different domains.

研究动机与目标

  • 探究来自无关领域(如自然语言)的预训练序列模型是否能提升离线强化学习的性能。
  • 解决从零开始训练基于Transformer的离线强化学习模型时收敛缓慢的问题。
  • 探索语言建模中学习到的特征向迁移至控制与游戏环境中的离线强化学习任务的可行性。
  • 开发提升语言与强化学习领域之间特征迁移能力的技术,例如扩展的位置嵌入和嵌入相似性鼓励机制。
  • 证明大规模自然语言数据的预训练可作为离线强化学习的有效归纳偏置,即使跨越模态边界也有效。

提出的方法

  • 通过将轨迹建模为以回报为条件的(状态,动作,奖励)标记序列,将离线强化学习建模为序列建模。
  • 使用序列建模目标,在离线强化学习数据集上对预训练的自回归语言模型(如GPT2、ChibiT)进行微调。
  • 引入扩展的位置嵌入,以更好地捕捉非语言序列中的时间结构。
  • 在微调过程中应用嵌入相似性鼓励,以对齐语言与强化学习序列的表示空间。
  • 采用标准的Transformer解码器架构并结合因果掩码,基于状态、奖励和回报自回归地建模动作。
  • 使用预测动作与实际动作之间的均方误差损失,端到端地在离线数据集上训练模型。

实验结果

研究问题

  • RQ1在维基百科或类似语料上预训练的语言模型能否有效迁移到控制与游戏环境中的离线强化学习任务?
  • RQ2与从随机初始化训练相比,自然语言上的预训练是否能提升离线强化学习的收敛速度和最终性能?
  • RQ3哪些技术(如位置嵌入扩展、表示对齐)能增强从语言到强化学习序列建模的迁移能力?
  • RQ4模型规模和预训练领域(语言 vs. 视觉)如何影响离线强化学习中的性能表现?
  • RQ5是否存在一种通用的序列建模归纳偏置,能够实现从语言到强化学习的跨领域迁移?

主要发现

  • 在D4RL Gym和Atari基准测试中,对GPT2和基于维基百科训练的ChibiT模型进行微调,实现了最先进(SOTA)性能。
  • 与从零开始训练标准决策Transformer相比,该方法将训练速度提升了3-6倍,训练时间从数小时缩短至数十分钟。
  • 与基于视觉的预训练或随机初始化相比,自然语言上的预训练显著提升了性能,表明语言特定的归纳偏置具有优势。
  • 扩展位置嵌入并鼓励语言与强化学习序列之间的嵌入相似性,可提升微调过程中的性能与稳定性。
  • 该模型在多种不同环境中均表现出一致的性能提升,表明其具备强大的跨任务与跨领域迁移能力。
  • 微调整个模型比冻结参数效果更优,凸显了模型对强化学习分布适应的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。