Skip to main content
QUICK REVIEW

[论文解读] A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision

Ajinkya Tejankar, Maziar Sanjabi|arXiv (Cornell University)|Dec 27, 2021
Multimodal Machine Learning Applications被引用 7
一句话总结

本文表明,Bag-of-Words(BoW)字幕——即自然语言字幕的简化版、词序打乱的版本——可作为训练可迁移视觉模型的有效监督信号,其零样本图像分类性能与使用完整字幕训练的模型相当。通过结合BoW监督、词频平衡以及对未对齐图像的自监督伪字幕生成,该方法在ImageNet-1k零样本设置下达到31.5%的top-1准确率,仅使用300万张图像-字幕对,与使用1500万对数据训练的CLIP模型性能相当。

ABSTRACT

Using natural language as a supervision for training visual recognition models holds great promise. Recent works have shown that if such supervision is used in the form of alignment between images and captions in large training datasets, then the resulting aligned models perform well on zero-shot classification as downstream tasks2. In this paper, we focus on teasing out what parts of the language supervision are essential for training zero-shot image classification models. Through extensive and careful experiments, we show that: 1) A simple Bag-of-Words (BoW) caption could be used as a replacement for most of the image captions in the dataset. Surprisingly, we observe that this approach improves the zero-shot classification performance when combined with word balancing. 2) Using a BoW pretrained model, we can obtain more training data by generating pseudo-BoW captions on images that do not have a caption. Models trained on images with real and pseudo-BoW captions achieve stronger zero-shot performance. On ImageNet-1k zero-shot evaluation, our best model, that uses only 3M image-caption pairs, performs on-par with a CLIP model trained on 15M image-caption pairs (31.5% vs 31.3%).

研究动机与目标

  • 探究图像-字幕对中自然语言监督的哪些成分对零样本视觉分类至关重要。
  • 确定简化且非语法结构的字幕(如Bag-of-Words, BoW)是否可在不降低性能的前提下替代完整字幕。
  • 探索通过生成伪BoW字幕来利用无字幕图像(未对齐图像)的方法,以扩展训练数据。
  • 通过类似自训练的框架结合真实与伪标签数据,提升零样本泛化能力。
  • 理解视觉-语言模型对语言结构的鲁棒性,以及文本编码器不变性的作用。

提出的方法

  • 通过打乱词序、基于位置或频率删除词语,或使用有限词汇表,将完整字幕转换为Bag-of-Words(BoW)形式。
  • 采用单模态自监督预训练:视觉编码器使用BYOL,文本编码器使用BERT,以提升对输入扰动的鲁棒性。
  • 应用词频平衡策略,减少BoW字幕中常见词的过表达,从而改善模型泛化能力。
  • 通过从对比字典中检索最近邻字幕并筛选高频词,为未对齐图像生成伪BoW字幕。
  • 在结合真实图像-字幕对与伪标签未对齐图像的半对齐数据集上,训练最终的视觉-语言模型。
  • 在预训练过程中使用图像与文本嵌入之间的对比损失,实现模态对齐,类似于CLIP的方法。

实验结果

研究问题

  • RQ1去除了句法结构的Bag-of-Words(BoW)字幕,能否作为训练零样本视觉识别模型的有效监督信号?
  • RQ2在BoW字幕中应用词频平衡是否能提升零样本性能,相比未平衡的BoW或完整字幕?
  • RQ3使用BoW字幕训练的模型在零样本图像分类任务中,其泛化能力是否与使用完整字幕训练的模型相当?
  • RQ4在多大程度上可以通过伪BoW字幕生成技术,利用未对齐图像来提升模型性能?
  • RQ5文本编码器的架构在多大程度上有助于对词序打乱等输入变形保持不变性?

主要发现

  • 使用BoW字幕替代完整字幕进行训练,零样本性能相当:在ImageNet-1k上达到30.1%的top-1准确率,而完整字幕的性能为29.5%。
  • 对BoW字幕应用词频平衡后,零样本准确率提升至30.1%,优于未平衡的BoW和完整字幕。
  • 仅使用300万张图像-字幕对并采用BoW监督训练的模型,在ImageNet-1k零样本设置下达到31.5%的top-1准确率,与使用1500万对数据训练的CLIP模型(31.3%)性能相当。
  • 通过最近邻检索与BoW过滤生成伪字幕,对未对齐图像进行伪标注,可提升性能,证明了半对齐学习的可行性。
  • 采用自监督预训练(BYOL与BERT)使模型对词序打乱等语言变形保持鲁棒性。
  • 尽管取得了显著提升,但在某些设置下,半对齐学习带来的性能增益有限,表明其相比完全监督或半监督学习仍具挑战性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。