Skip to main content
QUICK REVIEW

[论文解读] Semantic-Aware Generation for Self-Supervised Visual Representation Learning

Yunjie Tian, Lingxi Xie|arXiv (Cornell University)|Nov 25, 2021
Domain Adaptation and Few-Shot Learning参考文献 55被引用 7
一句话总结

该论文提出语义感知生成(SaGe),一种自监督视觉表征学习方法,通过使用预训练的语义感知评估器来指导重建,从而在自监督学习中提升图像生成质量,相较于像素级度量,显著提高了语义保真度。SaGe在ImageNet-1K及线性分类、目标检测等下游任务上达到最先进性能,证明语义感知生成优于传统的基于像素的生成代理方法。

ABSTRACT

In this paper, we propose a self-supervised visual representation learning approach which involves both generative and discriminative proxies, where we focus on the former part by requiring the target network to recover the original image based on the mid-level features. Different from prior work that mostly focuses on pixel-level similarity between the original and generated images, we advocate for Semantic-aware Generation (SaGe) to facilitate richer semantics rather than details to be preserved in the generated image. The core idea of implementing SaGe is to use an evaluator, a deep network that is pre-trained without labels, for extracting semantic-aware features. SaGe complements the target network with view-specific features and thus alleviates the semantic degradation brought by intensive data augmentations. We execute SaGe on ImageNet-1K and evaluate the pre-trained models on five downstream tasks including nearest neighbor test, linear classification, and fine-scaled image recognition, demonstrating its ability to learn stronger visual representations.

研究动机与目标

  • 为解决现有自监督方法过度关注判别性能而忽视生成质量的局限性。
  • 通过引入语义感知而非依赖像素级相似性,增强生成分支,从而提升视觉表征学习效果。
  • 验证语义感知评估器是否能显著提升生成图像质量及下游迁移性能。
  • 探究基于生成的代理是否能有效替代自监督框架中的对比学习或预测学习。
  • 通过视图特定的、语义感知的重建,减轻密集数据增强导致的语义退化。

提出的方法

  • 该框架包含一个编码器(目标网络)、一个解码器(生成头)以及一个预训练的评估网络用于语义评分。
  • 评估器通过对比原始图像与重建图像的语义特征,计算生成得分,使用预训练的自监督网络进行特征提取。
  • 损失函数结合了像素级的MSE损失与通过评估器特征计算的语义级相似性损失。
  • 编码器被训练以生成能使解码器重建原始图像并保留语义内容的特征,其质量由评估器衡量。
  • 系统通过数据增强生成视图对,端到端联合训练对比学习(判别性)与生成目标。
  • 采用感知测试评估语义保留程度,使用预训练的ImageNet分类器判断生成图像是否被正确分类。

实验结果

研究问题

  • RQ1与像素级度量相比,语义感知评估器是否能提升自监督表征学习中生成图像的质量?
  • RQ2在引入语义引导的生成分支后,是否能获得比纯判别性方法更强的可迁移视觉表征?
  • RQ3SaGe在下游任务上与最先进对比学习和预测学习自监督方法相比表现如何?
  • RQ4语义感知生成在多大程度上缓解了激进数据增强引起的语义退化?
  • RQ5生成目标是否能单独替代自监督预训练中的对比学习?

主要发现

  • SaGe在ImageNet-1K线性评估中达到最先进性能,优于MoCo-v2和SimCLR等方法。
  • 在最近邻测试中,SaGe达到86.7%的top-1准确率,表明其特征具有极强的可迁移性。
  • 在MS-COCO的目标检测与实例分割任务中,SaGe的mask AP达到43.2,超越先前自监督方法。
  • 感知测试显示,采用语义感知评估的模型在top-5准确率达87.5%,而未使用该评估的模型则失败,表明其语义保留能力更优。
  • 消融实验确认语义感知评估器至关重要:即使使用MSE损失,缺乏该评估器的模型性能仍显著偏低。
  • 使用预训练评估器可显著提升性能,当采用更深的ResNet-50评估器时,性能达到最强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。