[论文解读] Compositional Learning of Visually-Grounded Concepts Using Reinforcement
本文提出了一种组合式强化学习框架,使智能体能够先分别学习视觉相关的颜色-形状概念,再将其组合,从而在未见过的指令组合上实现20倍的训练加速,并展现出强大的零样本泛化能力。通过在单独的概念(颜色/形状)上进行预训练,并利用冻结的文本编码器(如CLIP),智能体显著降低了样本复杂度,并在3D导航环境中提升了解耦表示学习的效果。
Children can rapidly generalize compositionally-constructed rules to unseen test sets. On the other hand, deep reinforcement learning (RL) agents need to be trained over millions of episodes, and their ability to generalize to unseen combinations remains unclear. Hence, we investigate the compositional abilities of RL agents, using the task of navigating to specified color-shape targets in synthetic 3D environments. First, we show that when RL agents are naively trained to navigate to target color-shape combinations, they implicitly learn to decompose the combinations, allowing them to (re-)compose these and succeed at held-out test combinations ("compositional learning"). Second, when agents are pretrained to learn invariant shape and color concepts ("concept learning"), the number of episodes subsequently needed for compositional learning decreased by 20 times. Furthermore, only agents trained on both concept and compositional learning could solve a more complex, out-of-distribution environment in zero-shot fashion. Finally, we verified that only text encoders pretrained on image-text datasets (e.g. CLIP) reduced the number of training episodes needed for our agents to demonstrate compositional learning, and also generalized to 5 unseen colors in zero-shot fashion. Overall, our results are the first to demonstrate that RL agents can be trained to implicitly learn concepts and compositionality, to solve more complex environments in zero-shot fashion.
研究动机与目标
- 探究深度强化学习智能体是否能够从先前学习的概念中组合出新颖的颜色-形状指令。
- 评估在单独的视觉-语言概念(颜色、形状)上进行预训练是否能加速组合任务的学习。
- 在概念和组合训练之后,评估智能体在未见过的颜色-形状1-形状2组合上的零样本泛化性能。
- 考察冻结文本编码器(如CLIP、BERT)在视觉-语言指令学习中的样本效率影响。
- 通过LSTM激活嵌入分析所学表示的结构,以理解其解耦性和泛化能力。
提出的方法
- 作者开发了三个用于视觉-语言导航的3D环境,智能体需根据颜色-形状指令导航至目标物体。
- 智能体使用基于LSTM的策略网络进行深度强化学习训练,以处理语言和视觉输入。
- 概念预训练包括在仅颜色或仅形状指令上分别进行训练,随后在颜色-形状组合指令上进行联合训练。
- 该框架在未在训练中出现过的颜色-形状1-形状2组合上评估零样本泛化性能。
- 使用冻结的文本编码器(CLIP、BERT)提供预训练的语义表示,减少从零开始的端到端训练需求。
- 通过主成分分析(PCA)分析LSTM激活嵌入,以可视化新型组合在表示空间中的解耦程度。

实验结果
研究问题
- RQ1强化学习智能体能否分解并重新组合基于语言的指令,以泛化到未见过的颜色-形状组合?
- RQ2在单独的视觉-语言概念(颜色、形状)上进行预训练是否能减少组合学习所需的训练回合数?
- RQ3使用冻结文本编码器(如CLIP)如何影响视觉-语言导航任务中的样本效率?
- RQ4LSTM层中所学表示在多大程度上支持对新型指令组合的解耦且有序的编码?
- RQ5表示结构(如PCA维度)对零样本泛化性能有何影响?
主要发现
- 在颜色和形状概念上分别进行预训练的智能体,解决未见过的颜色-形状组合所需的训练回合数减少了20倍。
- 表现最佳的智能体在概念预训练后,再在组合指令上微调,其在零样本评估中对熟悉和未见过的颜色-形状1-形状2组合均获得了5.5的奖励。
- 直接在组合指令上训练的智能体在LSTM层中表现出高度重叠的表示,仅有两个主成分即可解释90%的方差,表明解耦性差。
- 相比之下,在组合前对概念进行预训练的智能体,至少需要六个主成分才能解释90%的方差,显示出更有序且解耦的表示空间。
- 预训练智能体的嵌入空间显示出相似新型组合的空间聚类(例如,'棱镜球体'和'胶囊圆柱体'在不同的子空间中聚集),从而实现了有效的零样本导航。
- 在概念学习上进行预训练显著提升了零样本泛化能力,表明对单个概念的结构化学习可增强强化学习智能体的组合推理能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。