[论文解读] Grounding Language to Entities and Dynamics for Generalization in Reinforcement Learning
本文提出了 Messenger,一个多人强化学习环境,其中智能体必须在没有预先存在的文本-观测映射的情况下,将自然语言手册中的内容与环境中的实体和动态机制进行对齐。所提出的模型 Emma(带多模态注意力的实体映射器)利用基于实体的注意力机制,选择性地关注相关的手册描述,并从稀疏奖励中端到端地进行学习,在未见过的游戏上,零样本泛化胜率比基线模型高出 40%。
We investigate the use of natural language to drive the generalization of control policies and introduce the new multi-task environment Messenger with free-form text manuals describing the environment dynamics. Unlike previous work, Messenger does not assume prior knowledge connecting text and state observations $-$ the control policy must simultaneously ground the game manual to entity symbols and dynamics in the environment. We develop a new model, EMMA (Entity Mapper with Multi-modal Attention) which uses an entity-conditioned attention module that allows for selective focus over relevant descriptions in the manual for each entity in the environment. EMMA is end-to-end differentiable and learns a latent grounding of entities and dynamics from text to observations using only environment rewards. EMMA achieves successful zero-shot generalization to unseen games with new dynamics, obtaining a 40% higher win rate compared to multiple baselines. However, win rate on the hardest stage of Messenger remains low (10%), demonstrating the need for additional work in this direction.
研究动机与目标
- 开发一个强化学习环境,要求智能体在没有预先存在的文本-观测映射的情况下,将自然语言手册与实体和动态机制对齐。
- 研究使用自由形式文本手册描述环境动态时,强化学习中的零样本泛化能力。
- 设计一种模型,仅通过标量奖励和原始文本学习实体与动态机制的对齐。
- 评估模型在文本描述中出现否定、中性实体和未见过的同义词时的鲁棒性。
- 在复杂、多实体、多动态的环境中,展示相较于现有基线模型,性能提升的泛化与对齐能力。
提出的方法
- 提出 Messenger,一个包含 12 种游戏变体的多任务环境,每种游戏均配有由众包提供的、自由形式的英文手册,描述实体和动态机制。
- 开发 Emma,一种可微分模型,采用基于实体的多模态注意力机制,利用实体表征作为查询,对手册中的词元进行注意力聚焦。
- 通过关注与实体相关的手册描述,为每个实体生成文本条件表征,随后由深度神经网络处理以生成动作。
- 通过仅使用环境回报作为信号,采用强化学习端到端训练整个模型,实现对齐与控制策略的联合学习。
- 利用注意力权重可视化并验证 Emma 是否学会将每个实体映射到手册中对应的描述句子。
- 通过消融研究评估模型在测试时变化中对否定描述、中性实体和未见过同义词的鲁棒性。
实验结果
研究问题
- RQ1智能体是否能够在没有预先存在的文本-观测映射的情况下,学习将自然语言对实体和动态机制的引用与环境对齐?
- RQ2模型在面对包含未见过的实体和新动态的新游戏中,其零样本泛化的程度如何?
- RQ3该对齐机制对文本变化(如增加描述、删除描述或未见过的同义词)的鲁棒性如何?
- RQ4多模态注意力能否有效区分名称相似但角色不同的实体,依据其动态行为进行消歧?
- RQ5否定描述对对齐性能和策略泛化能力有何影响?
主要发现
- 在 Messenger 环境中,Emma 在未见过的游戏上实现的胜率比多个基线模型高出 40%,实现零样本泛化。
- 在 Messenger 的最难关卡上,所有模型的胜率均较低(≤10%),表明将语言与细微动态差异对齐仍是重大挑战。
- Emma 对冗余描述表现出强鲁棒性,胜率达到 78%,而 BAM 基线仅为 36%。
- Emma 在同义词变化任务中泛化效果良好,胜率达到 75%,而 BAM 模型仅 8.5%。
- 注意力可视化证实,即使在缺乏共现对齐线索的情况下,Emma 也能学会将每个实体映射到手册中对应的描述句子。
- 在否定描述条件下,性能显著下降,S2 测试胜率降至 59%,表明模型在推理否定或反事实陈述方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。