[论文解读] TextTopicNet - Self-Supervised Learning of Visual Features Through Embedding Images on Semantic Text Spaces
TextTopicNet 提出了一种自监督方法,通过训练卷积神经网络(CNN)来预测图像可能作为插图出现的语义主题上下文(源自LDA嵌入的维基百科文章),从而学习视觉特征。通过利用多语言维基百科中免费获取的图文对,该模型在图像分类、目标检测和跨模态检索任务中实现了最先进(SOTA)的性能,且无需任何人工标注的标签。
The immense success of deep learning based methods in computer vision heavily relies on large scale training datasets. These richly annotated datasets help the network learn discriminative visual features. Collecting and annotating such datasets requires a tremendous amount of human effort and annotations are limited to popular set of classes. As an alternative, learning visual features by designing auxiliary tasks which make use of freely available self-supervision has become increasingly popular in the computer vision community. In this paper, we put forward an idea to take advantage of multi-modal context to provide self-supervision for the training of computer vision algorithms. We show that adequate visual features can be learned efficiently by training a CNN to predict the semantic textual context in which a particular image is more probable to appear as an illustration. More specifically we use popular text embedding techniques to provide the self-supervision for the training of deep CNN. Our experiments demonstrate state-of-the-art performance in image classification, object detection, and multi-modal retrieval compared to recent self-supervised or naturally-supervised approaches.
研究动机与目标
- 解决深度学习在计算机视觉领域中人工标注数据集的高成本与可扩展性有限的问题。
- 探索未经结构化的、自然共现的插图文章中的文本是否可作为视觉表征学习的免费且可扩展的监督信号。
- 研究通过LDA获得的主题级语义表征是否比词级或文档级嵌入在自监督视觉特征学习中更有效。
- 证明自监督视觉特征可与使用ImageNet进行监督预训练的特征相媲美甚至超越,且完全不依赖任何人工标注的标签。
提出的方法
- 该方法使用CNN预测给定图像作为插图所出现的维基百科文章的语义主题向量。
- 通过潜在狄利克雷分配(LDA)生成文本嵌入,以建模完整文章的主题级语义上下文。
- 使用对比损失端到端训练CNN,以对齐图像特征与对应的LDA编码文本主题向量。
- 该模型在包含超过100万张图文对的多语言维基百科大规模语料库上进行预训练,覆盖多样化领域。
- 下游任务(如图像分类、目标检测和跨模态检索)使用最后一层(概率层)的特征。
- 预训练过程中未使用任何人工标注的标签;监督信号完全来自维基百科文章中图像与其文本上下文的共现关系。
实验结果
研究问题
- RQ1未经结构化的、自然共现的维基百科文章中的语义文本嵌入能否作为视觉表征学习的有效自监督信号?
- RQ2通过LDA获得的主题级语义表征是否比词级或文档级文本嵌入在自监督视觉特征学习中更有效?
- RQ3从维基百科文章中学习的自监督视觉特征是否能在不进行微调的情况下泛化到下游任务(如图像分类和目标检测)?
- RQ4TextTopicNet在标准基准测试中的性能与监督方法及无监督自监督基线相比如何?
主要发现
- 在维基百科数据集上,TextTopicNet 的平均精度均值(mAP)达到38.94,优于所有无监督方法,并接近监督方法的性能。
- 在ImageCLEF数据集上,TextTopicNet 的mAP达到38.87,表明其在不同多语言和多领域设置下具有强大的泛化能力。
- 在PASCAL VOC 2007数据集上,TextTopicNet 在图像分类和目标检测任务中均达到最先进性能,且未在VOC数据集上进行任何微调。
- 定性结果表明,来自主题空间层(概率层)的特征可实现语义相关的图像检索,即使对于多义词查询(如'airplane'和'fighter')也有效。
- 该方法可成功检索与查询语义相关的图像,例如'airplane'和'flight',尽管未对语义相似性进行显式监督。
- 该模型学习到的是通用且宽泛主题的视觉特征,同时仍支持细粒度识别,这在PASCAL VOC 2007上无需任何类别特定监督即可正确检索类别,得到了充分验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。