Skip to main content
QUICK REVIEW

[论文解读] Unified Contrastive Learning in Image-Text-Label Space

Jianwei Yang, Chunyuan Li|arXiv (Cornell University)|Apr 7, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出统一对比学习(UniCL),一种新颖的对比学习框架,通过单一学习目标将图像-标签和图像-文本数据统一在共享的图文-标签空间中。通过结合监督数据与网络爬取数据,UniCL 在零样本、线性探测、微调和迁移学习基准上均达到最先进性能,平均在零样本识别任务上超越CLIP 14.5%,超越监督方法9.2%。

ABSTRACT

Visual recognition is recently learned via either supervised learning on human-annotated image-label data or language-image contrastive learning with webly-crawled image-text pairs. While supervised learning may result in a more discriminative representation, language-image pretraining shows unprecedented zero-shot recognition capability, largely due to the different properties of data sources and learning objectives. In this work, we introduce a new formulation by combining the two data sources into a common image-text-label space. In this space, we propose a new learning paradigm, called Unified Contrastive Learning (UniCL) with a single learning objective to seamlessly prompt the synergy of two data types. Extensive experiments show that our UniCL is an effective way of learning semantically rich yet discriminative representations, universally for image recognition in zero-shot, linear-probe, fully finetuning and transfer learning scenarios. Particularly, it attains gains up to 9.2% and 14.5% in average on zero-shot recognition benchmarks over the language-image contrastive learning and supervised learning methods, respectively. In linear probe setting, it also boosts the performance over the two methods by 7.3% and 3.4%, respectively. Our study also indicates that UniCL stand-alone is a good learner on pure image-label data, rivaling the supervised learning methods across three image classification datasets and two types of vision backbones, ResNet and Swin Transformer. Code is available at https://github.com/microsoft/UniCL.

研究动机与目标

  • 为解决现有方法将图像-标签与图像-文本数据分别处理所导致的局限性,即仅具备强判别能力或广泛的概念覆盖,而无法兼得。
  • 通过引入统一的图文-标签空间,将监督学习与图文对比学习统一于单一目标下。
  • 开发一种统一的学习范式,无缝整合两类数据,以学习语义丰富且具有判别性的视觉表征。
  • 证明UniCL在多种下游视觉任务中可超越监督学习与对比学习方法。
  • 展示UniCL即使仅在图像-标签数据上训练,也能在多个数据集与主干网络上媲美监督基线方法。

提出的方法

  • 该方法引入统一的图文-标签空间,其中每个图像均关联其标签及其对应的文本描述,从而实现对两类数据的联合学习。
  • 训练视觉编码器与文本编码器,利用来自共享标签的软化目标,通过对比损失对齐图像与文本特征。
  • 统一的对比学习目标通过单个损失函数结合图像-标签对的监督信号与图像-文本对的对齐信号,采用温度缩放的交叉注意力机制。
  • 该框架支持仅使用图像-标签数据、仅使用图像-文本数据或两者结合进行训练,且无需改变架构或训练流程。
  • 该方法采用数据增强与基于温度的对比损失,以提升特征判别力与语义对齐性。
  • 该方法支持端到端训练,通过协同利用两类数据的优势,显著提升特征质量。

实验结果

研究问题

  • RQ1统一的学习框架能否有效结合图像-标签与图像-文本数据,以提升视觉表征学习?
  • RQ2在共享空间中结合监督学习与对比学习,是否能在零样本、线性探测与微调设置下带来性能提升?
  • RQ3UniCL 是否能在仅使用图像-标签数据训练时仍实现优异性能,媲美监督基线?
  • RQ4在已基于图像-文本对预训练的模型中引入图像-标签数据,是否能增强其判别能力?
  • RQ5数据统一对特征空间质量有何影响,特别是在类别可分性方面?

主要发现

  • 在零样本识别基准上,UniCL 相较于图文对比学习方法平均提升9.2%,相较监督学习方法平均提升14.5%。
  • 在线性探测设置中,UniCL 相较于CLIP 提升7.3%,相较监督基线提升3.4%。
  • 当在YFCC-14M与ImageNet-21K各一半的数据上训练时,UniCL 在ImageNet-1K的零样本准确率上相比CLIP实现6%的绝对提升。
  • 在14个下游数据集中,结合两类数据使UniCL实现7%的绝对性能增益,其中11个数据集表现优于基线。
  • t-SNE可视化结果表明,UniCL 生成的特征空间更具判别性,即使未对犬种等细粒度类别进行显式监督,其类别也能清晰分离。
  • 仅在图像-标签数据上训练的UniCL,在三个图像分类数据集与两种主干网络(ResNet与Swin Transformer)上,性能媲美监督学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。