Skip to main content
QUICK REVIEW

[论文解读] History Compression via Language Models in Reinforcement Learning

Fabian Paischer, Thomas Adler|arXiv (Cornell University)|May 24, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

该论文提出 HELM(通过语言模型进行历史压缩),这是一种新颖的框架,利用冻结的预训练语言变换器(PLT)作为部分可观察强化学习中历史表示的记忆模块。通过采用 FrozenHopfield——一种无需训练的关联记忆机制,通过随机投影将观测映射到 PLT 令牌嵌入——该方法实现了无需微调 PLT 的样本高效策略学习,在 Minigrid 和 Procgen 环境中达到了最先进性能。

ABSTRACT

In a partially observable Markov decision process (POMDP), an agent typically uses a representation of the past to approximate the underlying MDP. We propose to utilize a frozen Pretrained Language Transformer (PLT) for history representation and compression to improve sample efficiency. To avoid training of the Transformer, we introduce FrozenHopfield, which automatically associates observations with pretrained token embeddings. To form these associations, a modern Hopfield network stores these token embeddings, which are retrieved by queries that are obtained by a random but fixed projection of observations. Our new method, HELM, enables actor-critic network architectures that contain a pretrained language Transformer for history representation as a memory module. Since a representation of the past need not be learned, HELM is much more sample efficient than competitors. On Minigrid and Procgen environments HELM achieves new state-of-the-art results. Our code is available at https://github.com/ml-jku/helm.

研究动机与目标

  • 通过利用预训练语言模型进行历史表示,提升部分可观察强化学习中的样本效率。
  • 解决将冻结的语言模型集成到无监督策略强化学习中而无需微调或权重更新的挑战。
  • 设计一种无需训练的机制,将观测和动作映射到预训练变换器的输入空间。
  • 使演员-评论家网络能够使用压缩的、抽象的历史表示,以提升部分可观察马尔可夫决策过程(POMDP)中的决策能力。
  • 在 Minigrid 和 Procgen 环境中以极低的训练开销实现最先进性能。

提出的方法

  • 提出 FrozenHopfield,一种冻结的关联记忆机制,通过随机投影将观测和动作映射到预训练的令牌嵌入。
  • 使用现代霍普菲尔德网络(MHN)存储并检索预训练的令牌嵌入,实现在无需训练情况下的检索。
  • 采用对观测的固定投影生成查询,从 MHN 中检索相关的令牌嵌入。
  • 将检索到的 PLT 历史表示与通过 CNN 嵌入的当前观测拼接,作为策略网络和价值网络的输入。
  • 仅使用浅层多层感知机和 CNN 作为可训练组件,整个训练过程中保持 PLT 冻结。
  • 将该框架应用于 PPO 等演员-评论家算法,实现使用抽象压缩历史表示的端到端强化学习训练。

实验结果

研究问题

  • RQ1能否在不微调的情况下,有效利用冻结的预训练语言模型进行部分可观察强化学习中的历史表示?
  • RQ2如何以无需训练的方式,将非语言模态(如像素观测)的观测映射到语言模型的输入空间?
  • RQ3与标准的基于 RNN 的记忆机制相比,使用冻结的 PLT 进行历史压缩是否能带来更高的样本效率?
  • RQ4现代霍普菲尔德网络能否作为可靠的、无参数的关联记忆机制,用于从冻结的 PLT 中检索相关令牌嵌入?
  • RQ5HELM 在样本效率和复杂 POMDP 基准测试的最终性能方面,相较于现有方法在多大程度上表现更优?

主要发现

  • HELM 在 Minigrid 和 Procgen 环境中实现了最先进性能,其样本效率和最终性能均优于先前方法。
  • 使用冻结的 PLT 进行历史表示显著提升了样本效率,因为模型无需从零开始学习历史抽象。
  • FrozenHopfield 仅通过随机投影和现代霍普菲尔德网络,即可实现有效且稳定的相关令牌嵌入检索,且无需任何训练。
  • MHN 中的检索误差随模式间分离度的增加呈指数级减小,确保了高保真度的记忆召回。
  • 在 MHN 中提高温度参数 β 可增强模式间的距离,减少表示坍塌,提升在不同环境中的泛化能力。
  • 定性分析表明,相似的视觉状态在 PLT 空间中映射到相同或相似的令牌,表明语义相似经验的有效抽象与聚类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。