Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised and Unsupervised Deep Visual Learning: A Survey

Yanbei Chen, Massimiliano Mancini|arXiv (Cornell University)|Aug 24, 2022
Domain Adaptation and Few-Shot Learning被引用 9
一句话总结

本综述提出了一套统一的分类体系,对最先进的半监督与无监督深度视觉学习方法进行分类,分析其在多样化计算机视觉任务中的设计原理。综述了利用未标注数据提升表征学习与模型泛化能力的先进深度学习算法,重点介绍了自监督技术、多模态学习,以及持续学习与开放集学习场景中的新兴挑战。

ABSTRACT

State-of-the-art deep learning models are often trained with a large amount of costly labeled training data. However, requiring exhaustive manual annotations may degrade the model's generalizability in the limited-label regime. Semi-supervised learning and unsupervised learning offer promising paradigms to learn from an abundance of unlabeled visual data. Recent progress in these paradigms has indicated the strong benefits of leveraging unlabeled data to improve model generalization and provide better model initialization. In this survey, we review the recent advanced deep learning algorithms on semi-supervised learning (SSL) and unsupervised learning (UL) for visual recognition from a unified perspective. To offer a holistic understanding of the state-of-the-art in these areas, we propose a unified taxonomy. We categorize existing representative SSL and UL with comprehensive and insightful analysis to highlight their design rationales in different learning scenarios and applications in different computer vision tasks. Lastly, we discuss the emerging trends and open challenges in SSL and UL to shed light on future critical research directions.

研究动机与目标

  • 提供对计算机视觉领域中半监督与无监督深度视觉学习近期进展的全面、系统性综述。
  • 解决监督学习的局限性,如标注成本高、因标签偏差与数据记忆化导致的泛化能力差。
  • 将半监督、无监督与自监督学习等不同范式统一于视觉表征学习的共同框架之下。
  • 识别并分析关键的方法论趋势,包括对比学习、伪标签法与多模态自监督。
  • 突出在持续学习、数据分布漂移以及多模态学习语义鸿沟方面的开放性挑战。

提出的方法

  • 提出统一的分类体系,基于学习目标、监督信号与网络架构设计,对 SSL 与 UL 方法进行分类。
  • 将方法划分为一致性训练、伪标签法、对比学习与基于掩蔽任务的自监督预训练等类别。
  • 分析联合优化中未标注损失函数(如对比损失、实例判别)与监督损失项的使用(公式 1)。
  • 回顾利用视觉-语言与音视频对应关系的多模态方法,以在无需人工标注的情况下构建自监督信号。
  • 研究流式学习与开放集学习设置,包括在线聚类与动态表征更新,以应对数据分布的演化。
  • 整合视觉-语言模型(如 CLIP、ALIGN)与多模态 Transformer(如 ViLBERT、LXMERT)的洞见,用于自监督表征学习。

实验结果

研究问题

  • RQ1如何有效利用未标注视觉数据,以提升少样本与零样本学习设置下的模型泛化能力?
  • RQ2半监督与无监督深度视觉学习方法的核心设计原则与差异是什么?
  • RQ3自监督掩蔽任务与对比学习如何在无需人工标注的情况下,促进鲁棒视觉表征的学习?
  • RQ4在流式学习、开放集学习与多模态学习场景中应用 SSL 与 UL 的关键挑战是什么?
  • RQ5如何利用多模态信号(如视觉-语言、音视频)构建有效的自监督信号,以支持无监督视觉表征学习?

主要发现

  • 自监督与无监督学习方法通过利用大规模未标注数据,显著提升了模型泛化能力,降低了对昂贵标注的依赖。
  • 对比学习与实例判别是目前最有效的自监督技术,在 ImageNet 上的性能已接近完全监督模型。
  • 视觉-语言模型(如 CLIP 与 ALIGN)通过在共享潜在空间中对齐图像与文本嵌入,实现了零样本迁移至下游任务。
  • 多模态自监督可减少模态间的语义鸿沟,但当模态相关性假设不成立时,性能会下降。
  • 从未标注数据中实现开放集学习与持续学习仍具挑战,主要因灾难性遗忘与伪标签法中的确认偏见。
  • 本综述提出的统一分类体系有助于更好地理解各类方法之间的关联性,并推动可扩展视觉表征学习的未来发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。