[论文解读] Unsupervised Learning of Visual Representations by Solving Jigsaw Puzzles
本文提出一种自监督方法,通过训练上下文无关网络(CFN)来解决拼图问题,从而学习视觉表征。图像块被打乱,模型需预测其正确的空间排列。该方法在图像分类和检测的迁移学习中达到最先进性能,优于以往的无监督方法,并接近有监督预训练的准确率。
In this paper we study the problem of image representation learning without human annotation. By following the principles of self-supervision, we build a convolutional neural network (CNN) that can be trained to solve Jigsaw puzzles as a pretext task, which requires no manual labeling, and then later repurposed to solve object classification and detection. To maintain the compatibility across tasks we introduce the context-free network (CFN), a siamese-ennead CNN. The CFN takes image tiles as input and explicitly limits the receptive field (or context) of its early processing units to one tile at a time. We show that the CFN includes fewer parameters than AlexNet while preserving the same semantic learning capabilities. By training the CFN to solve Jigsaw puzzles, we learn both a feature mapping of object parts as well as their correct spatial arrangement. Our experimental evaluations show that the learned features capture semantically relevant content. Our proposed method for learning visual representations outperforms state of the art methods in several transfer learning benchmarks.
研究动机与目标
- 开发一种自监督学习方法,通过将图像拼图求解作为先验任务,避免昂贵的人工标注。
- 设计一种上下文无关网络(CFN),通过限制早期感受野仅作用于单个图像块,以提升对部件和空间排列理解的特征学习能力。
- 评估所学特征在下游任务(如目标分类和检测)中的可迁移性。
- 证明通过拼图求解进行无监督预训练,在微调后可与或超越有监督预训练的性能。
提出的方法
- 该方法使用一种孪生九重卷积神经网络(CFN),在早期层中独立处理单个图像块,将上下文限制在单个图像块上。
- 从自然图像中提取图像块,并随机打乱为拼图,作为训练的先验任务。
- 通过在9个图像块的120种可能排列上使用分类头,训练网络预测打乱块的正确空间排列。
- CFN的设计参数量少于AlexNet,同时保持相当的语义学习能力。
- 在拼图任务上完成预训练后,使用最后卷积层的特征进行微调,以在下游分类和检测基准上进行迁移学习。
- 训练期间应用一种包含颜色抖动的数据增强策略,以提高模型鲁棒性。
实验结果
研究问题
- RQ1无监督拼图求解能否作为学习通用视觉表征的有效先验任务,且无需人工标注?
- RQ2上下文无关网络架构是否通过在空间推理前隔离部件级表征,从而改善特征学习?
- RQ3通过拼图求解学习的特征在迁移学习基准上的性能,与其它自监督和有监督方法相比如何?
- RQ4无监督预训练在多大程度上能缩小与有监督预训练在下游任务上的性能差距?
主要发现
- CFN在ImageNet分类任务上的表现优于所有先前的无监督方法,经迁移学习后达到57.3%的top-1准确率,超越了此前最先进无监督方法的性能。
- 在PASCAL VOC 2007检测基准上,该方法实现了64.1%的平均精度(mAP),超过以往的自监督方法。
- 定性图像检索结果表明,CFN特征对物体形状和类别高度敏感,最近邻样本通常属于同一类别。
- 当通过两层全连接层学习度量时,CFN特征显著优于其他自监督特征,包括Doersch等人和Wang与Gupta的方法。
- 模型在130万张图像上仅用2.5天即完成收敛,平均每张图像生成69个拼图,远快于先前方法。
- 滤波器和激活的可视化显示,网络学习到对物体部件(如人脸、翅膀、腿)和场景组件的专用检测器,且深层特征表现出更高复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。