Skip to main content
QUICK REVIEW

[论文解读] Fine-grained Recognition in the Wild: A Multi-Task Domain Adaptation Approach

Timnit Gebru, Judy Hoffman|arXiv (Cornell University)|Sep 7, 2017
Domain Adaptation and Few-Shot Learning参考文献 32被引用 8
一句话总结

本文提出了一种用于真实世界场景中细粒度识别的多任务域自适应框架,通过利用跨类别的共享属性来提升泛化能力。通过联合学习类别和属性级别的自适应,该方法在包含109.5万张图像和2,657个类别的大规模汽车数据集上,在半监督设置下的准确率从4.1%提升至19.1%。

ABSTRACT

While fine-grained object recognition is an important problem in computer vision, current models are unlikely to accurately classify objects in the wild. These fully supervised models need additional annotated images to classify objects in every new scenario, a task that is infeasible. However, sources such as e-commerce websites and field guides provide annotated images for many classes. In this work, we study fine-grained domain adaptation as a step towards overcoming the dataset shift between easily acquired annotated images and the real world. Adaptation has not been studied in the fine-grained setting where annotations such as attributes could be used to increase performance. Our work uses an attribute based multi-task adaptation loss to increase accuracy from a baseline of 4.1% to 19.1% in the semi-supervised adaptation case. Prior do- main adaptation works have been benchmarked on small datasets such as [46] with a total of 795 images for some domains, or simplistic datasets such as [41] consisting of digits. We perform experiments on a subset of a new challenging fine-grained dataset consisting of 1,095,021 images of 2, 657 car categories drawn from e-commerce web- sites and Google Street View.

研究动机与目标

  • 解决细粒度物体识别中的域偏移问题,即在精心构建的数据集上训练的模型在真实世界场景中表现不佳。
  • 通过利用电商网站和野外指南中现有且成本较低的标注数据,克服真实世界图像标注的高昂成本。
  • 实现在仅部分目标域类别具有标签但属性在许多类别中均可用的半监督自适应设置。
  • 通过利用细粒度类别之间的层次关系,借助共享属性提升知识迁移效果。
  • 基于来自电商和街景图像源的109.5万张图像和2,657个汽车类别,建立一个大规模的细粒度域自适应基准。

提出的方法

  • 提出一种多任务学习目标,通过共享的CNN架构联合优化类别级别和属性级别的分类。
  • 使用共享的特征编码器,随后分别连接类别和属性预测头,并引入领域对抗损失以对齐源域和目标域的特征。
  • 引入一种基于属性的自适应损失,用于正则化源模型,并提升对目标域的泛化能力。
  • 通过在目标域中利用可用的属性标签来指导学习,实现半监督自适应,即使类别标签稀疏。
  • 利用属性(如车身类型、品牌)的标注一致性高于细粒度类别这一事实,实现在特定类别未见时的迁移能力。
  • 通过结合源数据的监督损失和对抗性域对齐损失来训练模型,以最小化分布偏移。

实验结果

研究问题

  • RQ1使用共享属性进行多任务自适应是否能显著提升在真实世界目标域中标签数据有限的细粒度识别性能?
  • RQ2在属性和类别层面联合学习与单任务自适应相比,是否更有效地缓解了细粒度识别中的域偏移问题?
  • RQ3该方法是否能泛化到其他细粒度领域,例如基于WordNet的具有层次标签的领域?
  • RQ4性能提升在多大程度上依赖于每类的标注样本数量,特别是在低样本学习场景下?
  • RQ5在半监督自适应设置中,属性级别的监督是否能补偿类别级别标签的缺失?

主要发现

  • 所提出的多任务自适应方法在汽车数据集的半监督自适应设置下,将零样本准确率从4.1%提升至19.1%。
  • 与基线[49]相比,该方法在未见类别上的准确率提升了75%,且在无监督设置下,66%的目标类别实现了性能提升。
  • 在源图像标注数量较少的类别上,性能提升最为显著,标签数量与性能提升之间存在-0.29的相关性。
  • 通过使用多任务模型的特征激活,该模型在目标域中检索到更准确的最近邻样本,其最近邻检索性能优于基线[49]。
  • 属性标签数量较多的类别(如旅行车、SUV)表现出最大的准确率增益,而资源较少的类别(如仅含57张标注图像的双排驾驶室车型)则出现性能下降。
  • 该方法具有泛化能力:当引入基于WordNet的额外标签时,其在Office数据集上的性能也得到提升,尽管增益小于在汽车数据集上的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。