Skip to main content
QUICK REVIEW

[论文解读] Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning

Ruizhe Shi, Yuyao Liu|arXiv (Cornell University)|Oct 31, 2023
Reinforcement Learning in Robotics被引用 5
一句话总结

该论文提出 LaMo 框架,通过使用预训练语言模型(LMs)来增强离线强化学习(RL),方法包括:以语言模型初始化决策变换器,使用 LoRA 进行参数高效的微调,将线性投影替换为非线性多层感知机(MLPs),并增加语言预测辅助损失。LaMo 在稀疏奖励任务中达到最先进性能,并在密集奖励设置下显著缩小与基于值的方法之间的性能差距,尤其在低数据场景下表现突出。

ABSTRACT

Offline reinforcement learning (RL) aims to find a near-optimal policy using pre-collected datasets. In real-world scenarios, data collection could be costly and risky; therefore, offline RL becomes particularly challenging when the in-domain data is limited. Given recent advances in Large Language Models (LLMs) and their few-shot learning prowess, this paper introduces $ extbf{La}$nguage Models for $ extbf{Mo}$tion Control ($ extbf{LaMo}$), a general framework based on Decision Transformers to effectively use pre-trained Language Models (LMs) for offline RL. Our framework highlights four crucial components: (1) Initializing Decision Transformers with sequentially pre-trained LMs, (2) employing the LoRA fine-tuning method, in contrast to full-weight fine-tuning, to combine the pre-trained knowledge from LMs and in-domain knowledge effectively, (3) using the non-linear MLP transformation instead of linear projections, to generate embeddings, and (4) integrating an auxiliary language prediction loss during fine-tuning to stabilize the LMs and retain their original abilities on languages. Empirical results indicate $ extbf{LaMo}$ achieves excellent performance in sparse-reward tasks and closes the gap between value-based offline RL methods and decision transformers in dense-reward tasks. In particular, our method demonstrates superior performance in scenarios with limited data samples.

研究动机与目标

  • 为解决离线强化学习中的数据稀缺问题,通过利用预训练语言模型(LLMs)提升样本效率。
  • 克服先前方法在决策任务中未能充分利用语言模型的归纳偏差和 few-shot 泛化能力的局限性。
  • 设计一种框架,在最小化参数更新的前提下,保留预训练语言模型知识的同时,有效适应离线强化学习环境。
  • 提升在稀疏奖励和低数据场景下的性能,这些场景下标准离线强化学习方法表现不佳。
  • 通过消融实验和在多样化环境中的全面评估,验证将语言模型与决策变换器结合的有效性。

提出的方法

  • 使用预训练语言模型(如 GPT-2)初始化决策变换器,以注入通用世界知识和归纳偏差。
  • 采用 LoRA(低秩微调)实现参数高效的微调,仅更新 0.7% 的模型参数,同时冻结预训练语言模型的权重。
  • 将标准的线性输入嵌入和输出投影替换为多层感知机(MLPs),以更好地捕捉非线性状态-动作关系。
  • 在微调过程中引入辅助语言预测损失,以稳定训练并保留语言模型原有的语言理解能力。
  • 直接处理原始状态和动作观测(不通过语言描述),使方法可应用于连续控制和视觉基础任务。
  • 在 MuJoCo、Kitchen 和 Atari 环境中进行评估,通过不同数据比例测试样本效率和鲁棒性。

实验结果

研究问题

  • RQ1预训练语言模型能否被有效利用以提升离线强化学习中的样本效率?
  • RQ2使用预训练 LMs 初始化决策变换器并采用 LoRA 微调,是否能获得优于标准 DT 或基于值的方法的性能?
  • RQ3非线性 MLP 投影和辅助语言损失如何影响基于语言模型的离线强化学习智能体的稳定性和性能?
  • RQ4在低数据场景下,基于语言模型的模型在多大程度上能实现泛化,特别是在稀疏奖励环境中?
  • RQ5将语言模型中的预训练知识整合进来,能否缩小基于决策变换器与基于值的离线强化学习方法之间的性能差距?

主要发现

  • LaMo 在 D4RL 基准的稀疏奖励任务中达到最先进性能,优于决策变换器和保守 Q 学习(CQL)方法。
  • 在密集奖励任务中,LaMo 显著缩小了基于决策变换器与基于值的方法之间的性能差距,尤其在低数据比例下表现突出。
  • 在仅 1% 数据可用的情况下,LaMo 在稀疏奖励任务中取得平均得分 36.7,优于 DT(31.6)和无预训练的 LaMo(23.3),展现出强大的数据效率。
  • 消融实验确认预训练至关重要:在稀疏奖励任务中,移除预训练会使性能平均下降超过 10 分。
  • 使用非线性 MLP 和辅助语言损失可带来更稳定的训练过程,并更好地保留语言能力,表现为零样本泛化能力提升和评估方差降低。
  • 即使权重随机初始化,仅通过 LoRA 和更深的嵌入结构,更大的模型仍优于标准 DT,表明架构扩展和参数高效适配本身即具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。