Skip to main content
QUICK REVIEW

[论文解读] Self-supervised learning of visual features through embedding images into text topic spaces

Lluís Gómez, Yash Patel|arXiv (Cornell University)|May 24, 2017
Advanced Image and Video Retrieval Techniques参考文献 38被引用 18
一句话总结

本文提出 TextTopicNet,一种自监督方法,通过使用多模态维基百科文章中的LDA嵌入文本,训练卷积神经网络(CNN)以预测图像作为插图所处的语义主题上下文。通过利用噪声大、免费的文本注释,该模型学习到具有判别性的视觉特征,在图像分类、目标检测和多模态检索任务中实现了最先进(SOTA)性能,且无需任何人工标注的标签。

ABSTRACT

End-to-end training from scratch of current deep architectures for new computer vision problems would require Imagenet-scale datasets, and this is not always possible. In this paper we present a method that is able to take advantage of freely available multi-modal content to train computer vision algorithms without human supervision. We put forward the idea of performing self-supervised learning of visual features by mining a large scale corpus of multi-modal (text and image) documents. We show that discriminative visual features can be learnt efficiently by training a CNN to predict the semantic context in which a particular image is more probable to appear as an illustration. For this we leverage the hidden semantic structures discovered in the text corpus with a well-known topic modeling technique. Our experiments demonstrate state of the art performance in image classification, object detection, and multi-modal retrieval compared to recent self-supervised or natural-supervised approaches.

研究动机与目标

  • 开发一种自监督视觉特征学习方法,以避免对大规模人工标注数据集的依赖。
  • 探究来自插图化文章的文本语义是否可作为训练CNN的强监督信号。
  • 仅使用免费获取的多模态网络内容,实现深度视觉模型的端到端训练。
  • 证明通用的主题级文本表示可产生可迁移的视觉特征,适用于下游任务。
  • 在无需额外微调或标注的情况下,实现零样本多模态检索。

提出的方法

  • 该方法使用CNN预测给定图像的主题概率分布,其中主题由插图化维基百科文章中文本的LDA建模得出。
  • 每篇文章的文本内容通过潜在狄利克雷分配(LDA)编码为一个主题概率向量,构成视觉特征学习的监督信号。
  • CNN被训练以将图像映射到与其关联文本相同的主题空间中,使用预测主题分布与真实主题分布之间的交叉熵损失进行优化。
  • 在下游评估中,使用训练网络不同层(如 pool5、fc6、fc7、prob)的特征,无需微调。
  • 通过在主题空间中计算查询(图像或文本)嵌入与数据库条目之间的KL散度,实现多模态检索。
  • 该方法无需图像级别标注或在ImageNet上的预训练,仅依赖维基百科中弱对齐的图文对。

实验结果

研究问题

  • RQ1仅使用插图文章中文本的语义上下文,能否有效实现自监督视觉特征学习?
  • RQ2通过主题级监督学习的视觉特征,在图像分类和目标检测等下游任务中泛化能力如何?
  • RQ3当CNN被训练以预测图像外观的主题上下文时,其学习判别性视觉特征的能力有多强?
  • RQ4该方法在无任何标注数据的情况下,能否与有监督或自监督基线方法相媲美?
  • RQ5该模型是否学习到多义性图像表征,能够捕捉同义词及相关概念之间的语义相似性?

主要发现

  • TextTopicNet 仅使用维基百科图文对进行自监督训练,在 ImageNet-1K 图像分类任务中达到 74.1% 的 top-1 准确率,优于近期自监督方法。
  • 在 STL-10 数据集上,该模型达到 82.4% 的准确率,超过有监督基线方法 C-SVDDNet,并与使用外部数据训练的模型性能相当。
  • 在维基百科数据集的多模态检索任务中,TextTopicNet 的平均精度均值(MAP)达到 38.87%,优于所有无监督方法,接近有监督基线。
  • 定性分析表明,来自主题层(prob)的特征能产生语义相似的最近邻样本,即使视觉外观不同,表明其具备稳健的语义理解能力。
  • 该模型学习到多义性表征:如 'airplane'、'flight' 和 'aircraft' 等查询能检索到相似图像,展示了语义泛化能力。
  • 早期层(如 pool5)的特征产生更视觉相似的最近邻样本,表明在特征层次中存在语义相似性与视觉相似性之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。