Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Compositional Policy Learning via Language Grounding

Tianshi Cao, Jingkang Wang|arXiv (Cornell University)|Apr 15, 2020
Multimodal Machine Learning Applications参考文献 27被引用 4
一句话总结

本文提出了一种新颖的零样本组合策略学习框架,通过语言接地实现智能体在未见环境动态下的泛化能力。通过引入 BabyAI++,一个具有解耦视觉-动态配对和描述性文本的新环境,作者证明了多模态注意力融合方法(MMA)在强化学习和模仿学习设置下显著提升了零样本泛化性能,在未见组合上的成功率最高提升达20%。

ABSTRACT

Despite recent breakthroughs in reinforcement learning (RL) and imitation learning (IL), existing algorithms fail to generalize beyond the training environments. In reality, humans can adapt to new tasks quickly by leveraging prior knowledge about the world such as language descriptions. To facilitate the research on language-guided agents with domain adaption, we propose a novel zero-shot compositional policy learning task, where the environments are characterized as a composition of different attributes. Since there are no public environments supporting this study, we introduce a new research platform BabyAI++ in which the dynamics of environments are disentangled from visual appearance. At each episode, BabyAI++ provides varied vision-dynamics combinations along with corresponding descriptive texts. To evaluate the adaption capability of learned agents, a set of vision-dynamics pairings are held-out for testing on BabyAI++. Unsurprisingly, we find that current language-guided RL/IL techniques overfit to the training environments and suffer from a huge performance drop when facing unseen combinations. In response, we propose a multi-modal fusion method with an attention mechanism to perform visual language-grounding. Extensive experiments show strong evidence that language grounding is able to improve the generalization of agents across environments with varied dynamics.

研究动机与目标

  • 解决现有强化学习/模仿学习算法在面对未见环境动态时泛化能力不足的问题。
  • 使智能体能够利用自然语言描述,在视觉外观与动态的新组合之间实现知识迁移。
  • 开发一个支持零样本组合策略学习的基准环境,具备解耦的视觉-动态配对。
  • 评估语言接地在提升零样本泛化能力方面的作用,超越训练分布的泛化能力。
  • 提出一种多模态融合方法,将语言描述与视觉特征对齐,以提升策略泛化能力。

提出的方法

  • 提出 BabyAI++,一个新环境平台,将视觉外观与动态解耦,支持多样化的视觉-动态配对。
  • 为每对视觉-动态组合引入环境动态的程序化生成方法及相应的描述性自然语言文本。
  • 开发一种多模态注意力融合机制(MMA),将语言嵌入映射到视觉特征图的空间位置。
  • 利用交叉注意力将语言描述与特定视觉区域对齐,实现策略的动态适应。
  • 在生成的环境配置上,通过强化学习和模仿学习联合训练策略。
  • 通过在测试时保留未见的视觉-动态组合来评估泛化性能。

实验结果

研究问题

  • RQ1语言接地是否能使智能体在零样本设置下泛化到未见的视觉外观与动态组合?
  • RQ2当在未见的视觉-动态配对上测试时,现有语言引导的强化学习/模仿学习方法的性能如何退化?
  • RQ3与随机或打乱的文本相比,有意义的描述性文本在多大程度上能提升零样本泛化能力?
  • RQ4具有空间对齐注意力的多模态融合是否能提升策略在组合式环境变化下的泛化能力?
  • RQ5所提出的 MMA 方法与标准融合基线(如拼接和 FiLM)相比,在零样本组合泛化中的表现如何?

主要发现

  • 在强化学习设置下,MMA 方法在 GoTo-v1 上取得 0.575 ± 0.016 的成功率,显著优于基线方法(0.471 ± 0.016)和拼接基线(0.323 ± 0.015)。
  • 在模仿学习设置下,MMA 在 GoTo-v1 上取得 0.635 ± 0.015 的成功率,超过最佳基线 FiLM(0.692 ± 0.015),并优于次优方法拼接(0.475 ± 0.016)。
  • 在更复杂的 GoTo-v2 环境中,MMA 在强化学习下取得 0.405 ± 0.016 的成功率,优于基线(0.283 ± 0.014)和拼接方法(0.216 ± 0.013)。
  • 消融实验表明,有意义的描述性文本对性能至关重要,随机和打乱的文本导致显著更差的结果。
  • 注意力权重的可视化结果表明,模型能够学习将语言描述与特定视觉位置(如目标物体)对齐。
  • 该方法能有效泛化到未见的属性与动态,当在保留的视觉-动态组合上测试时,性能退化明显低于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。