Skip to main content
QUICK REVIEW

[论文解读] RTFM: Generalising to Novel Environment Dynamics via Reading

Victor W. Zhong, Tim Rocktäschel|arXiv (Cornell University)|Oct 18, 2019
Topic Modeling参考文献 27被引用 15
一句话总结

本论文提出RTFM,一种强化学习环境,要求智能体通过阅读和推理自然语言描述的环境动态来泛化至未见过的情境。所提出的txt 2 π模型捕捉目标、文档与观测之间的联合交互,相较于FiLM和语言条件CNN等基线模型,在复杂、多跳推理任务上通过课程学习实现更优的泛化能力和性能表现。

ABSTRACT

Obtaining policies that can generalise to new environments in reinforcement learning is challenging. In this work, we demonstrate that language understanding via a reading policy learner is a promising vehicle for generalisation to new environments. We propose a grounded policy learning problem, Read to Fight Monsters (RTFM), in which the agent must jointly reason over a language goal, relevant dynamics described in a document, and environment observations. We procedurally generate environment dynamics and corresponding language descriptions of the dynamics, such that agents must read to understand new environment dynamics instead of memorising any particular information. In addition, we propose txt2$π$, a model that captures three-way interactions between the goal, document, and observations. On RTFM, txt2$π$ generalises to new environments with dynamics not seen during training via reading. Furthermore, our model outperforms baselines such as FiLM and language-conditioned CNNs on RTFM. Through curriculum learning, txt2$π$ produces policies that excel on complex RTFM tasks requiring several reasoning and coreference steps.

研究动机与目标

  • 解决强化学习策略在未见过的环境动态下泛化的问题。
  • 开发一种基于环境的策略学习框架,使智能体必须阅读并推理动态的自然语言描述以达成目标。
  • 通过阅读理解实现不仅对新目标,也对新型环境动态的泛化。
  • 设计一种可扩展的、程序化生成的环境,防止记忆化并强制基于阅读的推理。
  • 使用课程学习方法评估目标、文档与观测之间联合推理的有效性。

提出的方法

  • 提出RTFM,一种程序化环境,其环境动态与自然语言描述的组合具有组合爆炸性规模,以防止记忆化。
  • 设计一种三重交互模型txt 2 π,联合编码语言目标、描述动态的文档以及环境观测。
  • 使用FiLM风格的自适应层,将策略网络基于目标、文档与观测的联合表示进行条件化。
  • 通过训练于逐步复杂的RTFM变体实施课程学习,从简单世界开始,逐步过渡到具有移动怪物和自然语言描述的10×10世界。
  • 在txt 2 π中应用注意力机制,根据目标和观测识别文档中的相关语句,实现选择性阅读。
  • 使用稀疏密集奖励进行策略的强化学习训练,并在未见动态和更大世界上评估泛化性能。

实验结果

研究问题

  • RQ1智能体是否能通过阅读自然语言描述而非记忆固定动态,实现对新环境动态的泛化?
  • RQ2对目标、文档与观测的联合推理在实现对未见动态与目标组合的泛化方面有多有效?
  • RQ3课程学习是否能提升在语言-环境强化学习中复杂、多跳推理任务上的样本效率与性能表现?
  • RQ4策略网络中的注意力机制是否能识别文档中对任务成功至关重要的相关信息?
  • RQ5所提模型在样本效率与最终胜率方面,相较于FiLM和语言条件CNN等强基线模型表现如何?

主要发现

  • txt 2 π在训练期间未见过的新环境动态上实现泛化,表明基于阅读的推理可在强化学习中实现稳健泛化。
  • 在RTFM基准测试中,txt 2 π在样本效率与最终胜率方面均优于FiLM和语言条件CNN。
  • 通过课程学习,txt 2 π在需要最多五步推理与指代消解的复杂RTFM任务上实现高性能。
  • 定性分析表明,txt 2 π根据目标与观测关注相关文档语句,特别是关于团队目标与怪物属性的语句。
  • 表现良好的策略能持续获取正确物品,避开干扰怪物,并仅在获得正确物品后才与目标互动;而表现较差的策略常选择错误物品或被困于躲避敌人。
  • 尽管采用课程学习,最佳模型在性能上仍落后于人类玩家,表明在语言-环境策略学习方面仍有显著提升空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。