[论文解读] Semantic Exploration from Language Abstractions and Pretrained Representations
本文提出利用预训练视觉-语言表征来改进强化学习中的探索策略,通过从自然语言中导出的语义有意义的状态抽象来定义新颖性。通过利用CLIP等模型生成的语言形状嵌入,该方法在3D环境中提升了样本效率和覆盖度,相较于基线内在奖励方法,使学习速度加快18–70%,导航任务中访问区域翻倍。
Effective exploration is a challenge in reinforcement learning (RL). Novelty-based exploration methods can suffer in high-dimensional state spaces, such as continuous partially-observable 3D environments. We address this challenge by defining novelty using semantically meaningful state abstractions, which can be found in learned representations shaped by natural language. In particular, we evaluate vision-language representations, pretrained on natural image captioning datasets. We show that these pretrained representations drive meaningful, task-relevant exploration and improve performance on 3D simulated environments. We also characterize why and how language provides useful abstractions for exploration by considering the impacts of using representations from a pretrained model, a language oracle, and several ablations. We demonstrate the benefits of our approach in two very different task domains -- one that stresses the identification and manipulation of everyday objects, and one that requires navigational exploration in an expansive world. Our results suggest that using language-shaped representations could improve exploration for various algorithms and agents in challenging environments.
研究动机与目标
- 解决在高维、部分可观察的3D环境中有效探索的挑战,传统基于新颖性的方法因视觉噪声和缺乏语义抽象而失效。
- 探究预训练视觉-语言表征(经由自然语言塑造)是否可作为强化学习中内在奖励设计的有效抽象。
- 评估基于语言的表征是否能在多样化的3D环境和强化学习算法(包括在线和离线策略)中提升探索性能。
- 通过与语言-预言机基线及使用替代表征(如ImageNet嵌入)的消融实验,理解语言抽象的贡献。
- 证明即使在训练过程中无语言预言机,语言形状表征也能实现有效探索,从而实现对未标注环境的可扩展性。
提出的方法
- 该方法使用预训练视觉-语言模型(如CLIP)将视觉观测嵌入与人类可理解概念对齐的语义表征。
- 内在奖励基于这些预训练文本或图像嵌入的新颖性计算,使用语言预言机或模型自身的图像编码器。
- 该方法通过将状态表征模块替换为语言形状特征,与现有的探索算法(如随机网络蒸馏RND和Never Give Up NGU)集成。
- 该方法在两个3D环境中进行评估:Playroom(物体操作)和City(大规模导航),均在Unity中模拟。
- 控制实验将语言形状表征与ImageNet嵌入及消融变体进行比较,以隔离语言的影响。
- 该框架在基于在线策略(IMPALA)和离线策略(R2D2)的强化学习算法上进行测试,以评估其在不同训练范式下的泛化能力。
实验结果
研究问题
- RQ1预训练视觉-语言表征能否作为定义强化学习中语义新颖性的有效抽象?
- RQ2与仅视觉或随机特征的方法相比,基于语言的表征在3D环境中如何提升样本效率和覆盖度?
- RQ3在复杂多物体场景中,语言抽象在多大程度上优于非语言表征(如ImageNet嵌入)?
- RQ4当训练过程中无语言预言机时,语言形状表征的优势是否依然存在?
- RQ5语言监督、表征质量与任务特异性等不同组件如何影响探索方法的有效性?
主要发现
- 在Playroom环境中,与基线RND和NGU方法相比,语言形状表征使物体操作任务的样本效率提升了18–70%。
- 在City环境中,使用语言探索的智能体访问区域是基线方法的两倍,表明在大规模导航任务中具有更优的覆盖能力。
- 该方法在算法间具有泛化能力,对在线策略(IMPALA)和离线策略(R2D2)训练设置均表现出性能提升。
- 在复杂任务(如'寻找')中,使用语言形状表征的智能体优于使用ImageNet嵌入的智能体,尤其在需要理解多物体场景时。
- 即使无语言预言机,仅使用预训练图像编码器的LSE-NGU变体也达到了与语言预言机版本相当的性能,证明了其鲁棒性与可扩展性。
- 消融研究证实,语言表征的语义一致性(而非仅表征容量)是提升探索性能的关键,其在多样任务与环境中的表现持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。