Skip to main content
QUICK REVIEW

[论文解读] Soft Expert Reward Learning for Vision-and-Language Navigation

Wang Hu, Qi Wu|arXiv (Cornell University)|Jul 21, 2020
Multimodal Machine Learning Applications参考文献 19被引用 5
一句话总结

本文提出了一种名为软专家奖励学习(SERL)的新强化学习框架,用于视觉-语言导航任务。该框架结合了软专家蒸馏(SED)与自感知(SP)模块,以提升泛化能力并减少误差累积。SED通过在随机投影空间中测量智能体与专家行为之间的相似性,提供一种软性、连续的奖励信号;SP则利用预测的导航时序来激励智能体更快抵达目标。SERL在VLN-R2R基准上实现了最先进性能,在未见测试集上达到56%的成功率和48%的SPL,优于先前方法在已见与未见环境中的表现。

ABSTRACT

Vision-and-Language Navigation (VLN) requires an agent to find a specified spot in an unseen environment by following natural language instructions. Dominant methods based on supervised learning clone expert's behaviours and thus perform better on seen environments, while showing restricted performance on unseen ones. Reinforcement Learning (RL) based models show better generalisation ability but have issues as well, requiring large amount of manual reward engineering is one of which. In this paper, we introduce a Soft Expert Reward Learning (SERL) model to overcome the reward engineering designing and generalisation problems of the VLN task. Our proposed method consists of two complementary components: Soft Expert Distillation (SED) module encourages agents to behave like an expert as much as possible, but in a soft fashion; Self Perceiving (SP) module targets at pushing the agent towards the final destination as fast as possible. Empirically, we evaluate our model on the VLN seen, unseen and test splits and the model outperforms the state-of-the-art methods on most of the evaluation metrics.

研究动机与目标

  • 解决基于行为克隆的视觉-语言导航智能体在未见环境中因误差累积而失效的问题。
  • 克服强化学习中视觉-语言导航任务里人工设计奖励函数的局限性。
  • 通过结合软模仿与基于内在时序的奖励信号,提升泛化能力。
  • 开发一种稳健且互补的奖励学习框架,同时提升导航的准确率与效率。
  • 在VLN-R2R基准的已见、未见及测试分割上均实现最先进性能。

提出的方法

  • 提出软专家蒸馏(SED)方法,通过在随机投影的潜在空间中计算智能体与专家观测-动作对之间的连续相似性得分,生成软性、可微的奖励信号。
  • 在随机投影空间中使用密度函数来度量智能体动作与专家动作的接近程度,以概率化对齐替代硬性模仿。
  • 设计自感知(SP)模块,用于预测智能体向目标的导航时序,并将该预测作为内在奖励,以加速收敛。
  • 将SED与SP奖励整合为统一的强化学习目标,使智能体既能学习专家行为,又能实现高效路径规划。
  • 采用策略梯度方法端到端训练智能体,结合复合奖励信号,实现模仿与效率的联合优化。
  • 推理阶段应用束搜索,通过选择最高概率轨迹进一步提升成功率。

实验结果

研究问题

  • RQ1与硬性行为克隆相比,软性连续模仿信号是否能有效减少视觉-语言导航中的误差累积?
  • RQ2基于内在时序的奖励是否能在不依赖人工设计的环境特定奖励的前提下,提升导航速度与泛化能力?
  • RQ3互补的奖励信号——软专家模仿与自感知——在未见环境中的性能提升中如何相互作用?
  • RQ4所提出的SERL框架是否能在VLN-R2R数据集的已见、未见及测试分割上有效泛化?
  • RQ5模型性能对平衡SED与SP奖励分量的超参数设置有多敏感?

主要发现

  • SERL模型在VLN-R2R数据集的测试未见分割上实现了56%的成功率与48%的SPL,优于最先进方法。
  • 仅使用SED的变体在验证未见集上将成功率提升6个百分点(至52%),SPL达0.48,证明了软模仿的有效性。
  • 仅使用SP的变体在验证未见集上将成功率提升至53%,SPL达0.46,表明内在时序奖励可增强导航效率。
  • 完整SERL模型同时集成SED与SP模块,在验证未见集上实现56%的成功率与48%的SPL,证实两者的互补性。
  • 结合束搜索后,SERL模型在测试未见集上的成功率提升至71%,表明其具备出色的鲁棒性与推理阶段性能。
  • 敏感性分析显示,模型在不同α与β超参数设置下均表现稳定,推荐α=β=0.1以获得最佳性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。