Skip to main content
QUICK REVIEW

[论文解读] Museum Exhibit Identification Challenge for Domain Adaptation and Beyond

Piotr Koniusz, Yusuf Tas|arXiv (Cornell University)|Feb 4, 2018
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文介绍了 Open MIC,一个用于博物馆展品识别的新基准数据集,旨在挑战领域自适应、第一人称识别和少样本学习。该数据集包含 866 个展品身份,通过受控源(手机拍摄)和真实场景目标(可穿戴摄像头拍摄)的设置获取,采用基于黎曼度量的 So-HoT 模型结合 Bregman 散度,在 Hon 子集上实现了 77.3% 的最先进准确率。

ABSTRACT

In this paper, we approach an open problem of artwork identification and propose a new dataset dubbed Open Museum Identification Challenge (Open MIC). It contains photos of exhibits captured in 10 distinct exhibition spaces of several museums which showcase paintings, timepieces, sculptures, glassware, relics, science exhibits, natural history pieces, ceramics, pottery, tools and indigenous crafts. The goal of Open MIC is to stimulate research in domain adaptation, egocentric recognition and few-shot learning by providing a testbed complementary to the famous Office dataset which reaches 90% accuracy. To form our dataset, we captured a number of images per art piece with a mobile phone and wearable cameras to form the source and target data splits, respectively. To achieve robust baselines, we build on a recent approach that aligns per-class scatter matrices of the source and target CNN streams [15]. Moreover, we exploit the positive definite nature of such representations by using end-to-end Bregman divergences and the Riemannian metric. We present baselines such as training/evaluation per exhibition and training/evaluation on the combined set covering 866 exhibit identities. As each exhibition poses distinct challenges e.g., quality of lighting, motion blur, occlusions, clutter, viewpoint and scale variations, rotations, glares, transparency, non-planarity, clipping, we break down results w.r.t. these factors.

研究动机与目标

  • 为解决视觉识别领域中文化遗址与博物馆场景下缺乏真实、真实场景的领域自适应基准的问题。
  • 通过提供具有显著领域差异和多样化视觉挑战的数据集,推动领域自适应、第一人称识别和少样本学习的研究。
  • 为 Office 数据集提供一个互补的测试平台,后者在约 90% 准确率处已达到性能饱和。
  • 支持在真实场景因素(如光照变化、运动模糊、遮挡和视角变化)下的评估。
  • 引入一种基于显著性的新型评估指标,反映博物馆环境中的人类注意力。

提出的方法

  • 使用受控源图像(手机拍摄,居中,无遮挡)和真实场景目标图像(志愿者在自然博物馆互动中通过可穿戴摄像头拍摄)构建数据集。
  • 作者采用基于黎曼度量的方法,利用类内散度矩阵和 Bregman 散度,对正定协方差矩阵进行建模,以实现鲁棒的领域对齐。
  • 将 So-HoT(二阶或更高阶迁移)模型扩展至非欧几里得几何,以提升在领域差异下的泛化能力。
  • 该方法采用端到端学习,通过矩阵导数将梯度反向传播至黎曼距离,包括使用投影矩阵以保持不变性。
  • 该框架支持多种评估协议:按展览训练/评估、跨展览训练,以及针对特定场景挑战的因子消融分析。
  • 引入一种基于显著性的新型评估指标,志愿者按感知中心性对展品进行排序,模型则在 top-k 预测准确率上进行评估。

实验结果

研究问题

  • RQ1由于光照、视角、遮挡和运动等因素导致的真实博物馆环境中领域偏移,如何影响最先进领域自适应模型的性能?
  • RQ2当应用于博物馆展品的视觉特征时,黎曼几何与 Bregman 散度是否能提升领域自适应的鲁棒性?
  • RQ3在这一新的真实场景基准上,监督领域自适应方法与无监督方法的性能相比如何?
  • RQ4诸如眩光、透明度和非平面性等场景特定因素在多大程度上会降低识别准确率?
  • RQ5当在全部 10 个博物馆展览空间的合并数据上进行训练时,模型的泛化能力如何?

主要发现

  • 所提出的基于黎曼度量的 So-HoT 模型在 Hon 子集上达到了 77.3% 的准确率,显著优于无监督方法(如 DHN 的 64.6% 和 JAN 的 65.2%)。
  • 在 Clk 子集上,该方法实现了 61.2% 的准确率,表明其在杂乱环境和视角变化等挑战条件下仍具有强大性能。
  • 无监督领域自适应方法(RTN、JAN、DHN)在最困难的子集上得分均低于 67%,表明在这些复杂的视觉领域中,仍需目标数据的标签信息。
  • 基于显著性的评估显示,采用领域自适应训练的模型在预测博物馆环境中人类注意力方面,显著优于基线方法。
  • 该数据集表明,即使是最先进的模型在处理非平面、透明或反光展品时仍表现吃力,凸显了对改进几何与光度不变性的迫切需求。
  • 在 Office-Home 数据集上的性能低于 Open MIC,表明 Open MIC 所呈现的领域偏移比现有基准更具挑战性和现实性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。