[论文解读] Mapping Instructions to Actions in 3D Environments with Visual Goal Prediction
该论文提出了一种用于3D环境中指令遵循的两阶段模型,将目标预测与动作生成解耦。该模型使用语言条件U-Net(LingUNet)从原始观测和语言中预测视觉目标位置,随后利用RNN生成朝向这些目标的动作。该方法在导航和家庭指令任务上取得了显著的性能提升,人类评估显示自动化指标与人类判断具有很强的相关性。
We propose to decompose instruction execution to goal prediction and action generation. We design a model that maps raw visual observations to goals using LINGUNET, a language-conditioned image generation network, and then generates the actions required to complete them. Our model is trained from demonstration only without external resources. To evaluate our approach, we introduce two benchmarks for instruction following: LANI, a navigation task; and CHAI, where an agent executes household instructions. Our evaluation demonstrates the advantages of our model decomposition, and illustrates the challenges posed by our new benchmarks.
研究动机与目标
- 为解决在交互式3D环境中执行自然语言指令的挑战,通过将目标预测与动作生成解耦来实现。
- 开发一种直接在视觉观测空间中预测目标的模型,无需依赖手工设计的符号表示或外部工具。
- 在两个新基准上评估模型——Lani用于导航任务,Chai用于家庭任务,以凸显现实世界指令遵循的复杂性。
- 证明监督学习用于目标预测、强化学习用于动作生成,相较于联合训练能获得更好的性能。
- 通过叠加在观测图像上的视觉注意力图,提供可解释、可人工验证的目标预测。
提出的方法
- 使用LingUNet——一种语言条件U-Net变体——基于语言和视觉输入,生成表示目标位置的图像像素概率分布。
- 将目标预测视为图像到图像的转换任务,从而实现可解释的视觉注意力图,突出目标区域。
- 在目标预测完成后,使用独立的RNN策略头生成动作序列,通过上下文Bandit策略梯度进行训练。
- 仅从演示数据端到端训练整个模型,无需预训练的目标检测器、解析器或外部知识。
- 引入两个新基准:Lani(6,000条3D环境中的导航指令)和Chai(1,596条涉及导航与操作的家庭指令序列)。
- 使用自动化指标(成功率、距离误差、操作准确率)和人类评估来衡量性能,自动化指标与人类判断之间具有强相关性(r = -0.65)。
实验结果
研究问题
- RQ1将目标预测与动作生成分离,是否能提升3D环境中指令遵循任务的性能?
- RQ2在无符号表示或外部表示的情况下,基于视觉的、语言条件的目标预测模型效果如何?
- RQ3使用监督学习进行目标预测、强化学习进行动作生成,与联合训练相比,性能提升程度如何?
- RQ4在复杂指令遵循任务中,自动化评估指标与人类判断的相关性如何?
- RQ5模型的关键失败模式和局限性是什么,特别是在指令模糊性和轨迹约束方面?
主要发现
- 在Lani导航基准上,所提模型取得63%的成功率(SD)和1.34的平均距离误差,显著优于基线,人类评估平均得分为3.78,接近人类执行者的4.38分。
- 在Chai家庭指令基准上,模型实现100%的操作准确率,但在导航方面表现不佳,表明多目标、多动作任务的复杂性更高。
- 消融研究显示,将学习过程分解为监督目标预测与基于策略的动作生成,能带来最大的性能提升,尤其在Chai任务上表现显著。
- 若提供目标的Oracle访问,导航性能显著提升,但无法有效支持操作学习,凸显了操作任务规划的复杂性。
- 自动化评估指标与人类判断具有强相关性(皮尔逊相关系数 r = -0.65,p = 5e-7),验证了其在自动化评估中的有效性。
- 模型在指令的时间协调性和代词指代理解方面表现不佳,表明其在处理多步之间依赖关系方面存在推理局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。