Skip to main content
QUICK REVIEW

[论文解读] Re-evaluating Automatic Metrics for Image Captioning

Mert Kilickaya, Aykut Erdem|arXiv (Cornell University)|Dec 22, 2016
Multimodal Machine Learning Applications参考文献 33被引用 14
一句话总结

本文通过对比 BLEU、ROUGE、METEOR、CIDEr、SPICE 和 Word Mover's Distance (WMD) 等自动指标,结合人工评分、对干扰性标题的准确率以及鲁棒性测试,重新评估了图像字幕生成的自动评估指标。研究发现,WMD 通过利用 word2vec 嵌入计算语义相似度,在与人工评分的相关性、对干扰的鲁棒性以及正确识别字幕的准确性方面均优于其他指标,表明其是图像字幕评估的更优指标。

ABSTRACT

The task of generating natural language descriptions from images has received a lot of attention in recent years. Consequently, it is becoming increasingly important to evaluate such image captioning approaches in an automatic manner. In this paper, we provide an in-depth evaluation of the existing image captioning metrics through a series of carefully designed experiments. Moreover, we explore the utilization of the recently proposed Word Mover's Distance (WMD) document metric for the purpose of image captioning. Our findings outline the differences and/or similarities between metrics and their relative robustness by means of extensive correlation, accuracy and distraction based evaluations. Our results also demonstrate that WMD provides strong advantages over other metrics.

研究动机与目标

  • 评估现有自动指标在多大程度上能够模拟人类判断。
  • 识别 BLEU、ROUGE、METEOR、CIDEr、SPICE 和 WMD 等广泛使用指标的优势与劣势。
  • 评估这些指标对字幕中语义干扰的鲁棒性。
  • 探究多种指标组合是否能提升评估性能。
  • 提出 WMD 作为图像字幕评估中优于现有指标的替代方案。

提出的方法

  • 作者使用 Flickr8k 和 MS COCO 数据集中的人工标注字幕评分,对六种指标(BLEU、ROUGE、METEOR、CIDEr、SPICE 和 WMD)进行了全面评估。
  • 通过计算自动指标得分与人工判断之间的斯皮尔曼等级相关系数,评估其与人类偏好的一致性。
  • 应用威廉显著性检验,判断不同指标对之间的差异是否具有统计学显著性。
  • 通过四种干扰类型(Replace-Scene、Replace-Person、Share-Scene 和 Share-Person)评估指标在区分正确字幕与干扰字幕方面的准确性。
  • 通过测量指标对同义词替换和语义扰动的敏感性,测试其鲁棒性。
  • 将 WMD、SPICE 和 METEOR 的归一化得分组合成统一指标,以评估潜在的性能提升。

实验结果

研究问题

  • RQ1现有自动指标在图像字幕任务中与人工判断的相关性如何?
  • RQ2在替换关键实体或共享场景元素等语义干扰下,哪些指标表现出最强的鲁棒性?
  • RQ3不同指标之间的性能是否存在统计学上的显著差异?
  • RQ4多种指标的组合是否能超越单一指标,提升评估性能?
  • RQ5使用词嵌入的 Word Mover’s Distance (WMD) 是否在性能上优于基于 n-gram 和语义图的指标?

主要发现

  • WMD 与人工判断的相关性最高,在 Flickr8k 上达到 0.66,在综合数据集上达到 0.45,优于包括 SPICE(0.64 和 0.42)在内的所有其他单一指标。
  • WMD 在区分正确字幕与干扰字幕方面表现最强,四种干扰类型下均达到最佳或第二佳的准确率。
  • 与 SPICE 相比,WMD 对同义词替换和语义扰动的敏感性显著更低,SPICE 在准确率和干扰鲁棒性测试中表现较差。
  • WMD + SPICE + METEOR 的组合指标在 Flickr8k 上的斯皮尔曼相关系数达到 0.66,在综合数据集上达到 0.45,显著优于单一指标(p < 0.01,威廉检验)。
  • METEOR 和 CIDEr 在相关性和鲁棒性方面也表现良好,但 WMD 在所有评估标准中均保持最高排名。
  • 研究揭示了不同指标之间存在显著且具有统计学意义的差异,表明当前指标不可互换,凸显了改进评估框架的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。