[论文解读] Grounding Language for Transfer in Deep Reinforcement Learning
本论文提出了一种基于模型的强化学习框架,利用环境的自然语言描述,实现跨领域有效策略迁移。通过使用可微分值迭代网络将文本描述与环境动态(如状态转移和奖励)对齐,该模型在迁移和多任务学习场景中,平均奖励最高提升14%,初始奖励最高提升11.5%,优于先前方法。
In this paper, we explore the utilization of natural language to drive transfer for reinforcement learning (RL). Despite the wide-spread application of deep RL techniques, learning generalized policy representations that work across domains remains a challenging problem. We demonstrate that textual descriptions of environments provide a compact intermediate channel to facilitate effective policy transfer. Specifically, by learning to ground the meaning of text to the dynamics of the environment such as transitions and rewards, an autonomous agent can effectively bootstrap policy learning on a new domain given its description. We employ a model-based RL approach consisting of a differentiable planning module, a model-free component and a factorized state representation to effectively use entity descriptions. Our model outperforms prior work on both transfer and multi-task scenarios in a variety of different environments. For instance, we achieve up to 14% and 11.5% absolute improvement over previously existing models in terms of average and initial rewards, respectively.
研究动机与目标
- 为高效解决在不同强化学习环境中迁移策略的挑战。
- 探究自然语言描述的环境实体是否可作为跨领域策略迁移的紧凑中间通道。
- 通过利用文本知识在未见环境中启动学习,提升训练样本效率。
- 开发一种统一模型,结合无模型强化学习与可微分规划模块,并引入融合文本的因子化状态表示。
- 在多样化的游戏环境设置下,于迁移学习和多任务学习场景中评估该方法。
提出的方法
- 该模型采用两部分状态表示,结合原始观测与实体的文本描述,实现领域通用的策略学习。
- 其采用可微分值迭代网络(VIN)通过迭代式地以可微方式更新值函数来执行规划。
- 将文本描述进行嵌入并投影至值函数空间,使模型能够在与环境交互前,基于实体类型(如友方或敌方)预测值图。
- 整个系统通过环境奖励端到端训练,VIN模块学习将描述实体的值信息传播至周围状态。
- 该方法同时考虑领域特定观测与基于语言的知识,使其对不完整或噪声描述具有鲁棒性。
- 该模型在GVGAI框架上基于Boulderchase和Bomberman等游戏进行评估,采用迁移学习和多任务学习协议。
实验结果
研究问题
- RQ1在深度强化学习中,环境实体的文本描述能否提升策略迁移性能?
- RQ2模型在与环境交互前,能否有效利用语言实现对新未见环境的学习启动?
- RQ3将语言与环境动态(状态转移和奖励)对齐,是否能实现更快的收敛速度和更好的跨领域泛化能力?
- RQ4在迁移设置中,将语言与可微分规划模块结合,相较于纯无模型或仅视觉的方法,表现如何?
- RQ5在仅提供文本描述而无先前经验的情况下,模型对未见实体的泛化能力如何?
主要发现
- 在迁移学习场景中,该模型相比先前方法,平均奖励最高提升14个百分点。
- 初始奖励最高提升11.5%,表明由于基于语言的启动机制,模型在新环境中能更快进入有效学习阶段。
- VIN模块生成的值图反映了描述的语义内容:在被描述为“友方”的实体附近分配更高值,而“敌方”实体附近分配更低值,即使在未与环境交互前亦然。
- 该模型能有效泛化至仅提供文本描述的未见实体,表明语言可在零样本迁移设置中引导策略学习。
- 在迁移和多任务学习设置中,该方法在多个评估指标上均优于标准深度强化学习基线方法和Actor Mimic迁移方法。
- 定性分析表明,该模型利用文本生成新领域中的合理值估计,显著降低了对大量环境交互的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。