[论文解读] BabyWalk: Going Farther in Vision-and-Language Navigation by Taking Baby Steps
BabyWalk 提出了一种视觉-语言导航智能体,通过使用记忆增强策略网络将长指令分解为一系列‘BabySteps’(微小步骤)——即更短的导航任务。该方法首先在这些微指令上模仿专家轨迹以学习基础策略,随后通过逐步增加路径长度的课程强化学习进一步优化性能,实现了在长路径导航任务上的最先进泛化能力,包括在 r6r 和 r8r 上的域外泛化,且性能接近域内水平。
Learning to follow instructions is of fundamental importance to autonomous agents for vision-and-language navigation (VLN). In this paper, we study how an agent can navigate long paths when learning from a corpus that consists of shorter ones. We show that existing state-of-the-art agents do not generalize well. To this end, we propose BabyWalk, a new VLN agent that is learned to navigate by decomposing long instructions into shorter ones (BabySteps) and completing them sequentially. A special design memory buffer is used by the agent to turn its past experiences into contexts for future steps. The learning process is composed of two phases. In the first phase, the agent uses imitation learning from demonstration to accomplish BabySteps. In the second phase, the agent uses curriculum-based reinforcement learning to maximize rewards on navigation tasks with increasingly longer instructions. We create two new benchmark datasets (of long navigation tasks) and use them in conjunction with existing ones to examine BabyWalk's generalization ability. Empirical results show that BabyWalk achieves state-of-the-art results on several metrics, in particular, is able to follow long instructions better. The codes and the datasets are released on our project page https://github.com/Sha-Lab/babywalk.
研究动机与目标
- 解决仅在短指令上训练的视觉-语言导航智能体在面对更长指令时泛化能力不足的问题。
- 在仅关注目标到达的基础上进一步提升指令遵循的保真度,尤其针对长路径任务。
- 探究将长指令分解为顺序微指令(BabySteps)是否能提升迁移性能。
- 开发一种结合短步骤模仿学习与逐步延长任务的课程强化学习的训练流程。
提出的方法
- 该智能体将长导航指令分解为一系列较短的中间‘BabySteps’,每个步骤具有独立的子目标。
- 记忆缓冲区用于存储过往经验,为后续步骤提供上下文感知能力,支持顺序决策。
- 第一阶段在配对的 BabySteps 与专家轨迹上使用模仿学习,以学习底层导航策略。
- 第二阶段采用基于课程的强化学习,从短路径逐步扩展到更长路径,以提升鲁棒性与泛化能力。
- 模型在 r4r 上进行训练,并在更长、未见过的数据集 r6r 和 r8r 上进行评估,以检验域外泛化能力。
- 通过多种指标进行评估:SPL、NDTW、SDTW、CLS 和 PL,并辅以消融实验与迁移分析。
实验结果
研究问题
- RQ1在仅用短路径任务进行训练的情况下,视觉-语言导航智能体能否有效泛化到显著更长、未见过的导航路径?
- RQ2将长指令分解为顺序 BabySteps 是否能提升指令遵循的保真度与导航泛化能力?
- RQ3在逐步增加路径长度的课程强化学习下,智能体在遵循长而复杂指令方面的能力如何变化?
- RQ4与端到端训练长序列相比,对微指令进行模仿学习在路径遵循准确率方面是否具有显著优势?
- RQ5记忆增强设计是否能提升长时序导航中的顺序推理与上下文感知能力?
主要发现
- BabyWalk 在长路径导航任务上达到最先进性能,在 r6r 上取得 25.9% 的 SDTW 分数,在 r8r 上取得 26.2%,优于所有基线模型。
- 在 r8r 上,BabyWalk 达到 48.3% 的 CLS 分数与 48.1% 的 SPL,接近域内智能体的性能表现。
- 与先前方法相比,BabyWalk 的泛化能力显著更强:例如,在仅用 r4r 训练时,其在 r6r 上的 SDTW 达到 25.4%,而次优方法仅为 15.3%。
- BabyWalk 在 r8r 上的性能几乎与域内模型持平,展现出强大的域外泛化能力,尤其在路径遵循相关指标上表现突出。
- 消融实验证实,BabyStep 分解与课程学习均至关重要,移除任一模块均导致性能显著下降。
- 在 r8r 上训练的模型整体泛化能力最强,表明在更长序列上学习能更有效地实现对短路径的内插,而非对外推至更长路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。