Skip to main content
QUICK REVIEW

[论文解读] NLVR2 Visual Bias Analysis

Alane Suhr, Yoav Artzi|arXiv (Cornell University)|Sep 23, 2019
Multimodal Machine Learning Applications参考文献 5被引用 8
一句话总结

本文识别出 NLVR2 基准中的视觉偏差问题,即在不同实例中图像对的标注不一致,可能导致模型利用视觉线索而非语言理解。本文提出一种新的评估协议,通过使用测试集的平衡与非平衡子集来衡量模型的鲁棒性,结果显示,如 VisualBERT 和 LXMERT 等当前最先进模型在该偏差下仍保持高度稳定,证实其主要依赖语言理解而非视觉捷径。

ABSTRACT

NLVR2 (Suhr et al., 2019) was designed to be robust for language bias through a data collection process that resulted in each natural language sentence appearing with both true and false labels. The process did not provide a similar measure of control for visual bias. This technical report analyzes the potential for visual bias in NLVR2. We show that some amount of visual bias likely exists. Finally, we identify a subset of the test data that allows to test for model performance in a way that is robust to such potential biases. We show that the performance of existing models (Li et al., 2019; Tan and Bansal 2019) is relatively robust to this potential bias. We propose to add the evaluation on this subset of the data to the NLVR2 evaluation protocol, and update the official release to include it. A notebook including an implementation of the code used to replicate this analysis is available at http://nlvr.ai/NLVR2BiasAnalysis.html.

研究动机与目标

  • 调查由于数据收集过程中人工标注者导致的标签分配非随机性,NLVR2 基准中是否存在视觉偏差。
  • 通过分析图像对的出现频率和多轮标注的一致性,量化视觉偏差的程度。
  • 开发一种新评估协议,隔离对视觉偏差具有鲁棒性的样本,以实现更公平的模型评估。
  • 在新协议上评估当前最先进模型,以判断其是否利用视觉偏差或依赖语言推理。
  • 建议将新评估子集整合至官方 NLVR2 基准中,以提升长期评估的可靠性。

提出的方法

  • 在训练集中识别出多次出现且标签相同或不同的图像对,以检测标注不一致性。
  • 计算在随机分配下的期望标签分布,并与实际观察到的频率进行比较,以检测偏差。
  • 构建一个新的评估子集,其中每个图像对出现两次且标签相反(平衡集),确保无法利用视觉偏差。
  • 构建第二个子集,其中图像对多次出现且标签相同(非平衡集),代表潜在的偏差。
  • 在两个新子集上评估现有的 SOTA 模型——VisualBERT 和 LXMERT——以测量其相对于原始测试集的性能变化。
  • 将平衡子集用作鲁棒评估标准,仅报告该子集上的准确率,以避免一致性度量中的偏差。

实验结果

研究问题

  • RQ1由于数据收集过程中标签分配非随机,NLVR2 中是否存在视觉偏差?
  • RQ2在重复出现的图像对中,视觉偏差的规模如何,以标签一致性衡量?
  • RQ3模型能否仅通过利用视觉偏差就实现高准确率,而完全独立于语言理解?
  • RQ4当前最先进模型在抗偏差评估子集上的表现与原始测试集相比如何?
  • RQ5在平衡子集上性能下降是否表明模型依赖语言推理而非视觉捷径?

主要发现

  • 在训练集中,共有 21,267 个图像对重复出现且标签相同,超过随机分配下的预期值 16,933,表明存在视觉偏差。
  • 仅依赖视觉偏差的最坏情况模型在开发集上达到 83.53% 的准确率,表明视觉偏差可被利用但并非主导因素。
  • 在开发集的平衡子集中,VisualBERT 的准确率下降 1.4 个百分点(从 67.4% 降至 66.0%),LXMERT 下降 0.9 个百分点,表明其对视觉偏差的依赖极低。
  • 在非平衡子集中,两个模型的性能均有轻微提升——VisualBERT 提升 1.7 个百分点,LXMERT 提升 1.5 个百分点,证实存在可被利用的视觉偏差。
  • 在测试集中,平衡子集上的性能保持稳定(VisualBERT:-1.3,LXMERT:-1.4),而非平衡子集上的性能略有上升,支持视觉偏差存在的结论。
  • 作者建议将平衡评估子集加入官方 NLVR2 基准,以实现更鲁棒的模型评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。