Skip to main content
QUICK REVIEW

[论文解读] Cross-Domain Self-supervised Multi-task Feature Learning using Synthetic Imagery

Zhongzheng Ren, Yong Jae Lee|arXiv (Cornell University)|Nov 24, 2017
Domain Adaptation and Few-Shot Learning参考文献 74被引用 4
一句话总结

本文提出了一种跨域自监督多任务网络,通过联合预测深度、表面法线和实例轮廓,从合成RGB图像中学习可泛化的视觉表征,同时利用对抗性特征空间域自适应技术弥合与真实图像之间的域差距。该方法在PASCAL VOC 2007分类和检测任务上实现了最先进(SOTA)的迁移学习性能,优于单任务基线方法和竞争性方法。

ABSTRACT

In human learning, it is common to use multiple sources of information jointly. However, most existing feature learning approaches learn from only a single task. In this paper, we propose a novel multi-task deep network to learn generalizable high-level visual representations. Since multi-task learning requires annotations for multiple properties of the same training instance, we look to synthetic images to train our network. To overcome the domain difference between real and synthetic data, we employ an unsupervised feature space domain adaptation method based on adversarial learning. Given an input synthetic RGB image, our network simultaneously predicts its surface normal, depth, and instance contour, while also minimizing the feature space domain differences between real and synthetic data. Through extensive experiments, we demonstrate that our network learns more transferable representations compared to single-task baselines. Our learned representation produces state-of-the-art transfer learning results on PASCAL VOC 2007 classification and 2012 detection.

研究动机与目标

  • 为解决ImageNet等大规模标注数据集在视觉表征学习中的高成本与可扩展性限制。
  • 克服由于合成图像与真实图像之间存在域偏移,导致从合成数据中学习通用视觉特征的挑战。
  • 通过在合成数据上联合利用多种自监督任务(深度、表面法线、轮廓)来提升特征的可迁移性。
  • 通过利用合成图像中免费的物理属性图作为监督信号,减少对人工标注的依赖。
  • 通过无监督特征空间域自适应技术进行对抗性训练,实现域不变表征。

提出的方法

  • 在合成RGB图像上训练一个多任务深度网络,以预测深度图、表面法线图和实例轮廓图作为自监督监督信号。
  • 网络采用共享编码器主干(如VGG风格),并为每个预测任务配备特定任务的头网络。
  • 引入对抗性域自适应模块,其中域判别器被训练以区分真实图像特征与合成图像特征。
  • 生成器(特征编码器)被更新以欺骗判别器,使其将真实特征分类为合成特征,将合成特征分类为真实特征,从而最小化特征空间中的域差异。
  • 整体训练目标结合了多任务预测损失(如深度使用L1损失,法线使用余弦损失)和对抗性损失以实现域对齐。
  • 模型在SUNCG数据集提供的0.5M至1.5M张合成图像上进行预训练,并在PASCAL VOC和NYUD等真实世界基准数据集上进行微调。

实验结果

研究问题

  • RQ1在合成数据上进行多任务自监督学习是否能产生比单任务基线方法更具可迁移性的视觉表征?
  • RQ2对抗性特征空间域自适应是否能有效减少合成图像与真实图像之间的域差距?
  • RQ3增加合成数据规模如何影响所学特征的可迁移性?
  • RQ4联合预测中层线索(深度、法线、轮廓)是否能隐式促进高层语义特征的学习?
  • RQ5所提出方法在下游真实世界任务上与最先进自监督和监督预训练方法相比表现如何?

主要发现

  • 所提出的多任务模型在ImageNet分类任务上达到68.0%的top-1准确率,在PASCAL VOC 2012检测任务上达到52.6%的平均精度均值,优于单任务基线方法。
  • 在NYUD表面法线估计任务上,角度误差小于11.25°的像素占比达到66.7%,超过自监督方法[71],并达到使用合成数据预训练的有监督方法的性能水平。
  • 将合成数据集规模从0.5M增加到1.5M,使分类和检测准确率分别提升0.5–0.6个百分点,证明了数据规模扩展的收益。
  • 在两个方向上同时欺骗判别器(即真实图像生成为合成特征,合成图像生成为真实特征)相比仅在一个方向上欺骗,性能略有下降,表明优化动态存在次优性。
  • 消融实验证实,多任务学习、域自适应和数据规模均对学习可迁移特征具有显著贡献。
  • 模型展现出强大的零样本迁移性能,表明自监督任务有效促进了高层语义表征的学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。