[论文解读] Following Instructions by Imagining and Reaching Visual Goals
本文提出视觉目标想象式指令遵循(IFIG),一种分层强化学习框架,使智能体能够通过从原始像素输入中顺序想象并达成视觉目标来遵循自然语言指令。在不依赖先验语言或感知知识的情况下,IFIG学习结构化的潜在表征,并利用内在动机生成指令相关的视觉目标,在模拟环境中的物体排列任务中,其性能优于具备真实状态监督的模型。
While traditional methods for instruction-following typically assume prior linguistic and perceptual knowledge, many recent works in reinforcement learning (RL) have proposed learning policies end-to-end, typically by training neural networks to map joint representations of observations and instructions directly to actions. In this work, we present a novel framework for learning to perform temporally extended tasks using spatial reasoning in the RL framework, by sequentially imagining visual goals and choosing appropriate actions to fulfill imagined goals. Our framework operates on raw pixel images, assumes no prior linguistic or perceptual knowledge, and learns via intrinsic motivation and a single extrinsic reward signal measuring task completion. We validate our method in two environments with a robot arm in a simulated interactive 3D environment. Our method outperforms two flat architectures with raw-pixel and ground-truth states, and a hierarchical architecture with ground-truth states on object arrangement tasks.
研究动机与目标
- 开发一种在物理环境中实现指令遵循的框架,最大限度减少对先验语言或感知知识的依赖。
- 解决在视觉环境中通过空间推理对长时程、时间延展的语言指令进行语义锚定的挑战。
- 使智能体能够通过自监督的视觉目标想象和目标达成策略学习复杂操作任务。
- 通过解耦视觉锚定与技能学习,提升视觉强化学习中的样本效率和泛化能力。
提出的方法
- 该框架使用变分自编码器(VAE)学习原始像素图像的结构化潜在表征,实现自监督的状态表征学习。
- 目标生成模块通过转换潜在状态,生成指令相关的视觉目标状态,支持任务导向的空间推理。
- 通过在潜在空间中使用目标条件化的强化学习目标,训练目标达成策略以在任意状态间移动。
- 系统采用内在动机以鼓励探索和目标想象,仅使用单一外部奖励信号指示任务完成。
- 架构采用分层强化学习,通过元控制器发出目标,控制器执行动作,二者均在潜在表征上运行。
- 通过SAC(软演员评论家)进行端到端训练,潜在空间维度设置为6,以捕捉6D状态因子(末端执行器和物体位置)。
实验结果
研究问题
- RQ1智能体能否仅通过从原始像素中想象视觉目标,无需先验语言或感知知识,实现对自然语言指令的遵循?
- RQ2在视觉强化学习中,视觉目标想象作为分解复杂、时间延展任务的机制,其有效性如何?
- RQ3在潜在空间中学习生成并达成视觉目标,是否相比平坦策略或具备真实状态监督的分层模型能提升性能?
- RQ4自监督的潜在表征在多大程度上可作为物体操作任务中有意义的子目标模态?
主要发现
- 在单物体环境中,IFIG的成功率是基于像素的平坦策略的2.47倍,尽管其参数量仅为后者的97%。
- 在多物体环境中,IFIG的成功率比基于像素的平坦基线高出3.41倍,展现出更优的泛化能力和样本效率。
- 在单物体设置中,IFIG的成功率比真实状态的平坦基线高出2.50倍,表明想象的视觉目标可能比访问真实状态更有效。
- 在多物体设置中,IFIG的成功率是真实状态分层模型的1.65倍,表明潜在视觉结构是一种强大的子目标模态。
- 对想象目标序列的可视化显示,智能体正确地将指令分解为逻辑子目标序列,例如相对移动物体。
- IFIG的控制器在最终误差性能上达到了真实状态分层控制器的90%,表明其在未访问真实状态的情况下仍具备强大的低级技能学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。