Skip to main content
QUICK REVIEW

[论文解读] The iMet Collection 2019 Challenge Dataset

Chenyang Zhang, Christine Kaeser‐Chen|arXiv (Cornell University)|Jun 3, 2019
Advanced Image and Video Retrieval Techniques参考文献 8被引用 12
一句话总结

本文介绍了iMet Collection 2019挑战数据集,这是一个大规模、研究级的数据集,包含155,531张大都会艺术博物馆的摄影作品,由博物馆专家和专业供应商标注了1,103个细粒度属性。该数据集支持多标签细粒度视觉识别,具有长尾分布和每张图像属性数量可变的特点,并被用于基于Kaggle的FGVC6竞赛,以推动艺术品自动标注与数字策展的发展。

ABSTRACT

Existing computer vision technologies in artwork recognition focus mainly on instance retrieval or coarse-grained attribute classification. In this work, we present a novel dataset for fine-grained artwork attribute recognition. The images in the dataset are professional photographs of classic artworks from the Metropolitan Museum of Art, and annotations are curated and verified by world-class museum experts. In addition, we also present the iMet Collection 2019 Challenge as part of the FGVC6 workshop. Through the competition, we aim to spur the enthusiasm of the fine-grained visual recognition research community and advance the state-of-the-art in digital curation of museum collections.

研究动机与目标

  • 解决现有艺术品识别数据集中高质量、细粒度属性标注不足的问题。
  • 利用专业博物馆艺术品图像支持细粒度视觉分类(FGVC)研究。
  • 通过大规模、经专家验证的数据集,实现文化遗产藏品的自动标注。
  • 利用计算机视觉技术推进博物馆藏品的数字策展。
  • 通过Kaggle竞赛建立多标签艺术品属性识别的基准。

提出的方法

  • 该数据集包含来自大都会艺术博物馆开放获取收藏的155,531张图像,所有图像均被调整为最短边300像素,并以PNG格式存储。
  • 标注来自两个经验证的来源:主题专家(SMEs)和使用预定义分类体系的专业标注员。
  • 使用枢纽标签(pivot labels)创建三重划分(训练集:109,274;验证集:7,443;测试集:38,814),以确保各划分间标签的一致性。
  • 将每类枢纽标签实例数少于三个的样本剔除;在所有三个划分中均未出现的标签被移除。
  • 评估指标采用Fβ分数,β=2,以在多标签分类中优先考虑召回率而非精确率。
  • 该挑战赛在Kaggle上以仅使用内核(kernel-only)的形式举办,要求开源模型并限制计算资源,以促进公平与透明。

实验结果

研究问题

  • RQ1在文化遗产藏品背景下,如何推进细粒度属性识别?
  • RQ2专家策划、研究级的标注对多标签艺术品分类性能有何影响?
  • RQ3长尾分布和每张图像属性数量可变性如何影响艺术品识别中的模型泛化能力?
  • RQ4基于Kaggle的、仅使用内核的竞赛模式能否有效推动自动化艺术品标注创新,并实现资源公平访问?
  • RQ5高质量、多属性数据集在推进博物馆藏品数字策展方面发挥何种作用?

主要发现

  • iMet Collection 2019数据集包含155,531张图像,标注了1,103个不同的属性,其中最频繁的标签为“Men”(19,974个训练样本)、“Women”(14,283个)和“French”(13,549个)。
  • 该数据集呈现长尾分布,最不常见的属性“Afgan”在训练集中仅有1个样本。
  • 每张图像的属性数量范围为1至11个,大多数样本具有2至4个属性,其中1个样本拥有11个属性。
  • 该竞赛吸引了来自435支队伍的500多名参赛者,结果在公开排行榜上追踪,且要求模型开源。
  • 该数据集被用于Kaggle上的首个仅使用内核的计算机视觉竞赛,促进了算法透明度与资源公平性。
  • 作者计划通过增加媒介、尺寸等额外语义组来扩展该数据集,并支持未来任务如实例检测、分割和图像字幕生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。