Skip to main content
QUICK REVIEW

[论文解读] Tell and Predict: Kernel Classifier Prediction for Unseen Visual Classes from Unstructured Text Descriptions

Mohamed Elhoseiny, Ahmed Elgammal|arXiv (Cornell University)|Jun 29, 2015
Domain Adaptation and Few-Shot Learning参考文献 33被引用 5
一句话总结

本文提出了一种基于未见类别非结构化文本描述的零样本视觉识别核化分类器预测框架。通过从文本空间到视觉空间学习领域迁移函数,并引入分布语义核以计算文本表示,该方法在无需图像级标注的情况下直接预测显式核分类器,在 Birds 数据集上实现了 5.35% 的多类分类准确率,相较于随机基线方法提升了 132.6%,优于先前最先进方法。

ABSTRACT

In this paper we propose a framework for predicting kernelized classifiers in the visual domain for categories with no training images where the knowledge comes from textual description about these categories. Through our optimization framework, the proposed approach is capable of embedding the class-level knowledge from the text domain as kernel classifiers in the visual domain. We also proposed a distributional semantic kernel between text descriptions which is shown to be effective in our setting. The proposed framework is not restricted to textual descriptions, and can also be applied to other forms knowledge representations. Our approach was applied for the challenging task of zero-shot learning of fine-grained categories from text descriptions of these categories.

研究动机与目标

  • 通过利用文本描述作为特权信息,实现在无需任何训练图像的情况下对未见类别进行零样本视觉识别。
  • 通过仅依赖类别级别的文本描述,消除对图像级属性标注的需求。
  • 直接从文本嵌入预测视觉领域中的显式核化分类器,实现对测试图像的直接应用。
  • 提出一种分布语义核(DS kernel)以有效捕捉类别描述之间的语义相似性,提升零样本迁移性能。
  • 通过在文本和基于属性的特权信息上应用该框架,展示其在多种模态下的鲁棒性与灵活性。

提出的方法

  • 将零样本学习建模为从特权空间(如文本或属性)到视觉分类空间的领域迁移问题,采用核化映射函数进行建模。
  • 采用基于单类 SVM 的调整方法优化领域迁移函数,以提升在视觉空间中的泛化能力与鲁棒性。
  • 引入基于预训练词嵌入(如 GoogleNews 上的 Word2Vec)的分布语义核(DS kernel),用于文本描述,实现类别描述间语义相似性的有效计算。
  • 应用多核学习(MKL)融合视觉特征(如 Caffe 的 ImageNet 模型提取的 CNN 特征)与核化文本表示,提升分类器性能。
  • 利用表示定理确保预测的分类器为显式核形式,从而实现对新测试图像的直接推理,无需重新训练。
  • 仅使用类别级别的特权信息进行模型训练,避免对图像-属性或图像-文本对标注的需求,使方法具备弱监督特性。

实验结果

研究问题

  • RQ1能否仅从类别未见视觉类别的非结构化文本描述中,直接预测其核化分类器,而无需任何训练图像?
  • RQ2分布语义核在捕捉文本描述之间语义关系方面,对零样本视觉分类的有效性如何?
  • RQ3从特权信息中直接预测显式核化分类器是否优于传统的基于属性或嵌入的零样本学习方法?
  • RQ4当使用文本描述与结构化属性作为特权信息时,该框架的性能表现有何差异?
  • RQ5核函数与特征表示(如 RBF、TF-IDF、DS 核)的选择在多大程度上影响零样本分类准确率?

主要发现

  • 所提方法在 Birds 数据集上使用文本的分布语义核与图像的 RBF 核,实现了 5.35% 的多类分类准确率,显著优于线性分类器基线(2.65%)及先前最先进方法。
  • 与 Norouzi 等人(2014)的方法相比(准确率为 2.3%),该框架在随机基线基础上实现了 132.6% 的性能提升。
  • 当使用属性作为特权信息时,方法在多类分类中达到 5.6% 的准确率,优于 DAP 模型(4.8%),准确率提升 16.6%,未见类别召回率提高 8.6%。
  • 与应用于 TF-IDF 文本特征的 RBF 核相比,使用分布语义核使性能提升 27.3%,证明了语义感知文本核的价值。
  • 该框架在未见类别上的平均召回率达到 76.7%,优于 DAP 模型的 68.1%,表明在零样本设置下具有更强的真实正例检测能力。
  • 该方法的性能高度依赖于特权信息的质量:属性表示优于文本描述,支持了‘更具意义的特权表示可带来更优的视觉分类器迁移’的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。