Skip to main content
QUICK REVIEW

[论文解读] On the Evaluation of Vision-and-Language Navigation Instructions

Ming Zhao, Peter Anderson|arXiv (Cornell University)|Jan 26, 2021
Multimodal Machine Learning Applications参考文献 34被引用 11
一句话总结

本文通过实证表明,现有的自动指标(如 BLEU、ROUGE、METEOR 和 CIDEr)在评估视觉-语言导航指令时效果不佳。为此,本文提出了一种新颖的指令-轨迹兼容性模型,该模型在与人类路径规划结果的相关性方面表现最佳,优于标准指标和 BERTScore。研究建议:在有参考指令时使用 SPICE 进行系统级评估,而在无参考指令时使用兼容性模型进行实例级评分。

ABSTRACT

Vision-and-Language Navigation wayfinding agents can be enhanced by exploiting automatically generated navigation instructions. However, existing instruction generators have not been comprehensively evaluated, and the automatic evaluation metrics used to develop them have not been validated. Using human wayfinders, we show that these generators perform on par with or only slightly better than a template-based generator and far worse than human instructors. Furthermore, we discover that BLEU, ROUGE, METEOR and CIDEr are ineffective for evaluating grounded navigation instructions. To improve instruction evaluation, we propose an instruction-trajectory compatibility model that operates without reference instructions. Our model shows the highest correlation with human wayfinding outcomes when scoring individual instructions. For ranking instruction generation systems, if reference instructions are available we recommend using SPICE.

研究动机与目标

  • 评估现有自动指标在基于视觉-语言导航指令生成中的有效性。
  • 通过人类路径规划者而非仅依赖自动化指标,评估最先进指令生成器的性能。
  • 开发一种无需参考指令的评估模型,用于衡量指令与轨迹之间的兼容性,以提升指令评分的准确性。
  • 根据是否有参考指令,提供选择评估指标的实际建议。

提出的方法

  • 提出一种双编码器神经网络模型,将指令和轨迹映射到共享潜在空间,以计算兼容性得分。
  • 使用对比损失和成对分类损失联合训练模型,以增强正确指令-轨迹对之间的对齐。
  • 利用回译和对轨迹及指令的扰动作为难负样本,以提升模型泛化能力。
  • 采用自助抽样法计算不同评估设置下相关性指标的 90% 置信区间。
  • 将所提出的兼容性模型与标准指标(BLEU、ROUGE、METEOR、CIDEr、SPICE、BERTScore)以及基于 VLN 代理的评分在人类评估数据上进行对比。
  • 建议在有参考指令时使用 SPICE 进行系统级评估,在无参考指令时使用兼容性模型进行实例级评估。

实验结果

研究问题

  • RQ1BLEU、ROUGE、METEOR 和 CIDEr 等现有自动评估指标与视觉-语言导航指令的人类路径规划表现之间的相关性如何?
  • RQ2当由人类路径规划者评估时,最先进指令生成器与简单模板基线系统相比表现如何?
  • RQ3学习得到的指令-轨迹兼容性模型能否作为个体导航指令的可靠、无参考评估指标?
  • RQ4哪些训练技术(如对比损失、回译、数据增强)能提升兼容性模型的性能?
  • RQ5哪种评估指标最能反映人类对指令质量与路径规划成功与否的判断?

主要发现

  • 标准文本指标(如 BLEU、ROUGE、METEOR 和 CIDEr)与人类路径规划结果之间无显著相关性,因此在评估基于视觉-语言的导航指令时无效。
  • 所提出的指令-轨迹兼容性模型在实例级别与人类路径规划表现的相关性达到最高的 Kendall’s τ,优于 BERTScore 和基于 VLN 代理的评分。
  • SPICE 是唯一在系统级别与人类评估结果呈现有意义相关性的标准指标,尤其在成功率和 SPL 等指标上表现突出。
  • 在训练中引入对比损失后,兼容性模型的 AUC 提升了 9–10%;回译通过改写正样本提升了模型性能。
  • 基于模型的评估方法对分布偏移具有鲁棒性,在跨领域指令生成器上表现良好,而标准指标则表现出宽泛的置信区间和不一致的排名。
  • 研究表明,指令生成仍有巨大提升空间,即使是最先进的模型在人类测试中也仅略优于模板基线系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。