[论文解读] Improving Intrinsic Exploration with Language Abstractions
该论文提出 L-AMIGo 和 L-NovelD,这两种基于语言的内在探索方法,通过用语言基础的抽象替代基于坐标的目标或状态新颖性,在强化学习中实现改进。利用自然语言表示语义进展,这些方法在 13 个 MiniGrid 和 MiniHack 任务中将探索效率和性能提升 47–85%,尤其在需要对原始状态进行高层次推理的复杂、稀疏奖励环境中表现显著。
Reinforcement learning (RL) agents are particularly hard to train when rewards are sparse. One common solution is to use intrinsic rewards to encourage agents to explore their environment. However, recent intrinsic exploration methods often use state-based novelty measures which reward low-level exploration and may not scale to domains requiring more abstract skills. Instead, we explore natural language as a general medium for highlighting relevant abstractions in an environment. Unlike previous work, we evaluate whether language can improve over existing exploration methods by directly extending (and comparing to) competitive intrinsic exploration baselines: AMIGo (Campero et al., 2021) and NovelD (Zhang et al., 2021). These language-based variants outperform their non-linguistic forms by 47-85% across 13 challenging tasks from the MiniGrid and MiniHack environment suites.
研究动机与目标
- 为解决基于状态的新颖性度量在内在探索中的局限性,后者常奖励表面化或低层次行为而非有意义的语义进展。
- 探究语言是否可作为更有效的媒介,用于编码抽象的高层环境抽象,以引导高效探索。
- 在受控环境中评估基于语言的探索方法,与 AMIGo 和 NovelD 等近期强基线模型对比,而非仅与标准强化学习算法比较。
- 通过引入自然语言课程并可视化训练期间的语言新颖状态,提升学习过程的可解释性。
- 考察组合语言语义对探索性能的影响,特别是在需要复杂、顺序推理的任务中。
提出的方法
- 通过将教师提出的基于坐标的奖励目标替换为中间目标的自然语言描述,扩展 AMIGo 框架,形成 L-AMIGo。
- 修改 NovelD 内在奖励机制,增加对在语言注释上具有语义新颖性的状态访问的额外奖励,从而得到 L-NovelD。
- 使用预训练语言模型对环境交互过程中生成的语言消息进行嵌入和比较,实现超越原始状态差异的语义新颖性检测。
- 在 MiniGrid 和 MiniHack 环境中使用基于语言的内在奖励训练智能体,并在稀疏奖励、长时序任务上进行评估。
- 为基于语言的目标引入难度度量,以独立于外部奖励的方式衡量任务完成的进展。
- 可视化并分析训练过程中最语言新颖的消息,以评估可解释性和课程开发。
实验结果
研究问题
- RQ1与基于状态的新颖性度量相比,语言抽象是否能提升稀疏奖励强化学习中的内在探索性能?
- RQ2在样本效率和最终性能方面,基于语言的探索与 AMIGo 和 NovelD 等强基线相比表现如何?
- RQ3组合语言语义在需要抽象推理的复杂环境中在多大程度上提升了探索性能?
- RQ4语言注释是否能通过支持自然语言课程或可视化新颖语义状态来改善训练过程的可解释性?
- RQ5即使存在噪声或无关的中间语言消息,是否仍能支持有效的探索,还是会导致性能下降?
主要发现
- L-AMIGo 和 L-NovelD 在 13 个具有挑战性的 MiniGrid 和 MiniHack 任务中,相比其非语言对应方法,性能提升 47–85%,证明了基于语言的抽象具有显著性能增益。
- 性能增益在抽象、高层级任务中最为显著,如 Wand of Death (Hard) 和 MultiRoom-N4-Extreme,这些任务中语义理解至关重要。
- 基于语言的探索提升了可解释性:L-AMIGo 发展出自然语言语义目标的课程,L-NovelD 允许在训练过程中可视化最语言新颖的消息。
- 消融实验表明,组合语言语义显著提升了探索性能,对比组合与非组合语言表征。
- 即使存在噪声或无关的中间语言消息,语言增强方法仍保持强劲性能,表明对不完美语言信号具有鲁棒性。
- 在需要战略性利用环境特征(如瓶颈)的任务(如 Quest (Medium))中,基于语言的探索使智能体能比基于状态的方法更有效地学习复杂、多步行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。