[论文解读] The Met Dataset: Instance-level Recognition for Artworks
本文介绍了The Met数据集,这是一个大规模、高质量的基准数据集,用于艺术作品的实例级识别,采用大都会艺术博物馆提供的40万张工作室环境拍摄的图像作为训练集,以及1,100张游客拍摄的测试图像(存在分布偏移)。实验表明,结合自监督对比学习与有监督对比学习,并使用kNN分类器,可实现最先进性能,尤其在长尾类别上表现突出,凸显了非参数分类在开放集、实例级识别任务中的潜力。
This work introduces a dataset for large-scale instance-level recognition in the domain of artworks. The proposed benchmark exhibits a number of different challenges such as large inter-class similarity, long tail distribution, and many classes. We rely on the open access collection of The Met museum to form a large training set of about 224k classes, where each class corresponds to a museum exhibit with photos taken under studio conditions. Testing is primarily performed on photos taken by museum guests depicting exhibits, which introduces a distribution shift between training and testing. Testing is additionally performed on a set of images not related to Met exhibits making the task resemble an out-of-distribution detection problem. The proposed benchmark follows the paradigm of other recent datasets for instance-level recognition on different domains to encourage research on domain independent approaches. A number of suitable approaches are evaluated to offer a testbed for future comparisons. Self-supervised and supervised contrastive learning are effectively combined to train the backbone which is used for non-parametric classification that is shown as a promising direction. Dataset webpage: http://cmp.felk.cvut.cz/met/
研究动机与目标
- 解决艺术作品领域实例级识别(ILR)缺乏大规模、高质量数据集的问题。
- 构建一个能反映现实世界挑战的基准,包括分布偏移、长尾类别分布以及高类别间相似性。
- 通过提供包含游客拍摄图像和分布外图像的真实测试环境,支持领域泛化、开放集ILR的研究。
- 评估自监督与对比学习方法在艺术领域这一具有挑战性的细粒度识别任务中的有效性。
提出的方法
- 数据集基于大都会艺术博物馆的开放获取藏品构建,包含约40万张训练图像,覆盖22.4万个独特的艺术品类别,每件艺术品均在工作室条件下拍摄。
- 测试集包含1,100张游客拍摄的图像(存在分布偏移)以及大量与大都会艺术博物馆无关的分布外(OOD)图像。
- 采用对比学习框架,结合SimSiam与Con-Syn方法,并额外引入真实正样本对(Real-closest)以提升特征判别能力。
- 使用包含合成正样本对与真实正样本对的对比损失对主干网络进行微调,并在学习到的特征上使用k-最近邻(kNN)分类器评估性能。
- 对比参数化分类器与非参数化kNN分类器的表现,结果表明kNN在低样本量类别上表现更优。
- 结合自监督预训练(如SimSiam)与有监督对比学习,以提升在长尾数据上的泛化能力与鲁棒性。
实验结果
研究问题
- RQ1在存在长尾分布与高类别间相似性的艺术作品实例级识别任务中,自监督与对比学习方法的有效性如何?
- RQ2在长尾、开放集ILR场景下,非参数化kNN分类器是否能超越参数化分类器?特别是在艺术作品数据上?
- RQ3工作室环境图像与真实世界图像之间的分布偏移如何影响模型泛化能力?有哪些训练策略可缓解此问题?
- RQ4在对比学习中,使用真实正样本对(Real-closest)相较于合成正样本对,对艺术作品识别有何影响?
- RQ5在The Met数据集上进行微调,相较于ImageNet或SWSL预训练,在此任务上的性能提升程度如何?
主要发现
- R18IN Con-Syn+Real-closest模型在测试集上达到55.0%的top-1准确率,较基线R18IN模型提升7.5%。
- kNN分类器优于参数化分类器,尤其在仅有一个训练样本的类别上,相对准确率提升最高达50%。
- 使用SimSiam进行自监督预训练,即使未引入任何额外监督,性能仍优于ImageNet基线模型。
- 在对比学习中引入真实正样本对(Real-closest)显著提升了性能,尤其在与其他真实正样本对正确区分时效果更明显。
- Con-Syn+Real-closest方法在所有评估方法中表现最佳(top-1准确率为55.0%),证明了结合合成与真实正样本对的优势。
- 性能增益在低样本量类别上最为显著,证实了结合对比学习特征的kNN方法在长尾ILR任务中具有高度有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。