Skip to main content
QUICK REVIEW

[论文解读] Collecting Image Description Datasets using Crowdsourcing

Ramakrishna Vedantam, C. Lawrence Zitnick|arXiv (Cornell University)|Nov 12, 2014
Multimodal Machine Learning Applications参考文献 12被引用 4
一句话总结

本文介绍了两个新的图像描述数据集——ABSTRACT-50S 和 PASCAL-50S——每个图像包含 50 个由人工编写的描述,通过 Amazon Mechanical Turk 收集。通过指示工作者转录场景中的显著元素而非自由描述,作者获得了更高品质、更客观的描述,与每个图像仅提供 5 个描述的现有数据集相比,显著提升了每张图像的描述多样性。

ABSTRACT

We describe our two new datasets with images described by humans. Both the datasets were collected using Amazon Mechanical Turk, a crowdsourcing platform. The two datasets contain significantly more descriptions per image than other existing datasets. One is based on a popular image description dataset called the UIUC Pascal Sentence Dataset, whereas the other is based on the Abstract Scenes dataset con- taining images made from clipart objects. In this paper we describe our interfaces, analyze some properties of and show example descriptions from our two datasets.

研究动机与目标

  • 解决缺乏高质量、多样化、每张图像包含多个描述的图像描述数据集的问题。
  • 收集大量人工编写的、客观的图像描述,以更好地捕捉人类在图像描述中的差异性。
  • 通过使用“转录”指令而非开放式“描述”提示,提高图像描述的质量和相关性。
  • 创建适用于训练和评估视觉-语言模型的金标准数据集,特别是在零样本学习和图像字幕生成任务中。
  • 提供基于真实世界图像(PASCAL-50S)和抽象、卡通风格图像(ABSTRACT-50S)的数据集,以支持更广泛的研究应用。

提出的方法

  • 使用 Amazon Mechanical Turk 从不同且合格的工作者处收集每张图像的 50 个描述。
  • 要求工作者为美国籍,且 HIT 批准率高达 95% 以上,累计批准数超过 500 次,以确保质量。
  • 指示工作者“转录”场景中的主要元素,而非自由描述,以减少主观性和想象成分。
  • 设计用户界面,强调在一组相似图像中,描述的客观性、清晰度和可识别性。
  • 应用拒绝标准,过滤掉对话式、过度描述或语法错误的句子。
  • 创建两个数据集:PASCAL-50S 来自 UIUC Pascal Sentence Dataset 中的真实图像,ABSTRACT-50S 来自合成的抽象图像。

实验结果

研究问题

  • RQ1与使用“描述”指令相比,使用“转录”指令在多大程度上提升了图像字幕的质量和客观性?
  • RQ2每张图像收集 50 个字幕对图像描述的多样性与代表性有何影响?
  • RQ3真实图像(PASCAL-50S)与抽象图像(ABSTRACT-50S)在字幕长度和语言风格上存在哪些差异?
  • RQ4所收集的字幕在多大程度上反映了图像中细粒度的物体重要性与语义差异?
  • RQ5这些数据集在提升视觉-语言任务(如零样本学习和图像字幕生成)中的性能方面是否具有支持潜力?

主要发现

  • PASCAL-50S 数据集包含 1000 张图像,每张图像有 50 个由人工编写的描述,总计 50,000 个描述。
  • ABSTRACT-50S 数据集包含 500 张抽象图像,每张图像有 50 个描述,总计 25,000 个描述。
  • PASCAL-50S 中的平均字幕长度为 8.8 个词,而 ABSTRACT-50S 中为 10.59 个词,表明对抽象图像的描述更详细。
  • 使用“转录”指令显著提升了所收集描述的客观性和与图像的相关性,相较于自由描述任务。
  • 这些数据集在描述风格和表达方式上表现出丰富的多样性,反映出人类对同一图像的不同感知。
  • 这些数据集适用于视觉-语言理解、零样本学习和图像字幕生成任务中模型的训练与评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。