[论文解读] Robust Navigation with Language Pretraining and Stochastic Sampling
该论文提出PRESS,一种视觉-语言导航智能体,利用大规模预训练语言模型(BERT/GPT)提升指令泛化能力,并采用随机采样训练策略以缓解暴露偏差。通过结合这些技术,PRESS在R2R基准上实现了53%的加权路径长度SPL新SOTA,较之前方法绝对提升6%。
Core to the vision-and-language navigation (VLN) challenge is building robust instruction representations and action decoding schemes, which can generalize well to previously unseen instructions and environments. In this paper, we report two simple but highly effective methods to address these challenges and lead to a new state-of-the-art performance. First, we adapt large-scale pretrained language models to learn text representations that generalize better to previously unseen instructions. Second, we propose a stochastic sampling scheme to reduce the considerable gap between the expert actions in training and sampled actions in test, so that the agent can learn to correct its own mistakes during long sequential action decoding. Combining the two techniques, we achieve a new state of the art on the Room-to-Room benchmark with 6% absolute gain over the previous best result (47% -> 53%) on the Success Rate weighted by Path Length metric.
研究动机与目标
- 提升视觉-语言导航智能体在未见过环境和指令下的泛化能力。
- 解决训练过程中序列动作解码的暴露偏差问题。
- 开发一种在分布偏移下仍表现稳健的通用导航策略。
- 证明简单而有效的技术——预训练与随机采样——可超越复杂SOTA模型。
提出的方法
- 微调大规模预训练语言模型(BERT与GPT)作为指令编码器,以提升对未见过环境的零样本泛化能力。
- 提出一种随机采样策略,在训练过程中混合使用教师强制与学生强制,以缩小训练与推理之间的差距。
- 采用序列到序列模型,通过语言与视觉特征之间的交叉注意力进行动作预测。
- 在推理阶段,使用上下文平均池化将多个指令聚合为单一轨迹。
- 采用混合训练策略,在训练期间随机采样动作,使智能体能够从自身错误中学习。
- 端到端训练策略,以最大化给定指令下专家轨迹的对数似然。
实验结果
研究问题
- RQ1大规模预训练语言模型能否提升视觉-语言导航中的零样本泛化能力?
- RQ2在训练期间采用随机采样策略是否能减少暴露偏差,并提升推理阶段的鲁棒性?
- RQ3将预训练语言模型与随机动作采样相结合,能否在R2R基准上实现SOTA性能?
- RQ4不同训练策略下,已见与未见环境之间的性能差距如何比较?
主要发现
- PRESS在R2R测试集上达到53% SPL,较之前SOTA(47% SPL)绝对提升6%。
- 在未见环境中,PRESS实现55% SPL,显著优于基线seq2seq模型(23% SPL),并有效缩小了已见-未见环境间的性能差距。
- 使用BERT与GPT作为指令编码器相比LSTM展现出更优的泛化能力,其中BERT在未见环境中表现更优。
- 随机采样(SS)在未见环境中优于教师强制与学生强制,尤其在减少误差传播方面表现更佳。
- 定性结果表明,PRESS能正确理解罕见或未见过的词汇(如'mannequins'和'manikins'),而基线模型则易被误导。
- 消融实验证实,预训练语言模型与随机采样均为关键组件,二者结合可实现最强泛化能力与性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。