[论文解读] Discovering Visual Patterns in Art Collections with Spatially-consistent Feature Learning
本文提出一种自监督方法,通过利用相邻匹配之间的空间一致性作为监督信号,微调深度特征,以在艺术收藏品中发现近似重复的视觉模式。该方法在跨模态定位任务中达到最先进性能,并在无需人工标注的情况下,实现大规模艺术数据集中准确且与风格无关的模式发现。
Our goal in this paper is to discover near duplicate patterns in large collections of artworks. This is harder than standard instance mining due to differences in the artistic media (oil, pastel, drawing, etc), and imperfections inherent in the copying process. The key technical insight is to adapt a standard deep feature to this task by fine-tuning it on the specific art collection using self-supervised learning. More specifically, spatial consistency between neighbouring feature matches is used as supervisory fine-tuning signal. The adapted feature leads to more accurate style-invariant matching, and can be used with a standard discovery approach, based on geometric verification, to identify duplicate patterns in the dataset. The approach is evaluated on several different datasets and shows surprisingly good qualitative discovery results. For quantitative evaluation of the method, we annotated 273 near duplicate details in a dataset of 1587 artworks attributed to Jan Brueghel and his workshop. Beyond artwork, we also demonstrate improvement on localization on the Oxford5K photo dataset as well as on historical photograph localization on the Large Time Lags Location (LTLL) dataset.
研究动机与目标
- 自动化发现艺术作品中重复出现的视觉主题,减少对人工艺术史分析的依赖。
- 解决在不同艺术媒介、风格和形变下匹配近似重复视觉元素的挑战。
- 通过利用空间一致性作为自监督信号,在无需人工标注的情况下学习领域特定的深度特征。
- 在大规模艺术收藏和跨模态定位任务中展示该方法的有效性。
- 引入一个包含1,587幅雅各布·布雷盖尔及其工作室成员作品的新标注数据集,用于评估视觉对应匹配性能。
提出的方法
- 使用自监督学习微调预训练的深度特征,其中相邻特征匹配之间的空间一致性作为监督信号。
- 基于RANSAC和投票的几何验证流程,用于识别图像间的一致匹配,实现实例级对应关系发现。
- 仅使用预测匹配的空间一致性,在目标艺术收藏(如布雷盖尔、Oxford5K、LTLL)上训练特征,无需任何人工标注。
- 采用两阶段发现流程:首先,提取局部特征并在图像间进行匹配;其次,利用几何验证和聚类识别重复模式。
- 利用学习到的特征提升牛津5K和大时间延迟定位(LTLL)数据集上的一次性定位性能。
- 在布雷盖尔数据集上训练特征,并评估其在其他数据集上的迁移能力,表明领域特定微调可提升性能。
实验结果
研究问题
- RQ1相邻特征匹配之间的空间一致性是否可有效用作自监督信号,以适应深度特征用于艺术收藏中的视觉模式发现?
- RQ2在无任何人工标注的情况下,自监督特征适应策略在多样化艺术媒介和风格中实现实例级匹配的改进程度如何?
- RQ3深度特征的领域特定微调对历史照片定位等跨模态定位任务的性能影响如何?
- RQ4所提方法能否以高精度自动发现大规模艺术收藏中重复出现的视觉主题(如特定人物、物体、构图)?
- RQ5训练数据质量与模式多样性对自监督特征学习方法性能的影响如何?
主要发现
- 该方法在大时间延迟定位(LTLL)数据集上的一次性定位任务中达到88.5%的准确率,优于先前最先进方法。
- 在牛津5K数据集上,经在牛津数据集上微调后,使用发现得分达到85.7%的mAP,与[35]使用ResNet101的最先进结果相当。
- 在布雷盖尔数据集上微调特征后,LTLL上的性能显著提升(88.5% vs. 56.1%的基线),证明了领域特定适应的价值。
- 定性结果表明,该方法成功识别出布雷盖尔和鲁本斯画作中重复出现的圆形画框或面部特征等主题。
- 在牛津5K和LTLL数据集上,该方法均优于标准的最大池化特征和余弦相似度基线,在LTLL上取得21.1%的绝对性能提升。
- 在布雷盖尔数据集上训练的性能优于在LTLL上训练,表明该方法从训练数据中更丰富、更重复的视觉模式中获益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。