Skip to main content
QUICK REVIEW

[论文解读] Predicting Visual Exemplars of Unseen Classes for Zero-Shot Learning

Soravit Changpinyo, Wei‐Lun Chao|arXiv (Cornell University)|May 26, 2016
Domain Adaptation and Few-Shot Learning参考文献 29被引用 15
一句话总结

本文提出了一种新颖的零样本学习方法,通过训练基于核的回归器,将语义嵌入映射到视觉特征中心,从而预测未见类别的视觉样本,该方法利用语义空间中的聚类结构。在包含超过20,000个未见类别的ImageNet数据集上,该方法显著优于先前方法,通过建模语义描述与视觉聚类中心之间的预测关系,实现了最先进性能。

ABSTRACT

Leveraging class semantic descriptions and examples of known objects, zero-shot learning makes it possible to train a recognition model for an object class whose examples are not available. In this paper, we propose a novel zero-shot learning model that takes advantage of clustering structures in the semantic embedding space. The key idea is to impose the structural constraint that semantic representations must be predictive of the locations of their corresponding visual exemplars. To this end, this reduces to training multiple kernel-based regressors from semantic representation-exemplar pairs from labeled data of the seen object categories. Despite its simplicity, our approach significantly outperforms existing zero-shot learning methods on standard benchmark datasets, including the ImageNet dataset with more than 20,000 unseen categories.

研究动机与目标

  • 为解决在缺乏标注训练样本的情况下识别物体类别的问题,特别是在长尾分布中存在稀有或新定义类别的场景下。
  • 通过利用语义嵌入空间中的结构化聚类模式,改进零样本学习方法。
  • 开发一种仅使用已见类别数据和语义描述来预测未见类别视觉样本的方法。
  • 通过建模语义表示与视觉聚类中心之间的预测关系,缩小已见类别与未见类别之间的泛化差距。

提出的方法

  • 该方法训练多个基于核的回归器,从已见类别的语义表示中预测视觉样本特征(聚类中心)。
  • 假设语义嵌入应对相应视觉样本的位置具有预测能力,从而在嵌入空间中施加结构约束。
  • 回归器在已见类别的语义-视觉对上进行训练,学习从语义向量到视觉特征向量的映射关系。
  • 通过预测未见类别的视觉样本,该训练好的回归器可推广至未见类别,从而支持最近邻分类。
  • 该方法对维度压缩具有鲁棒性,在视觉特征被投影到低维空间(如d=50)时仍保持强劲性能。
  • 该方法还可通过为未见类别提供更优的视觉样本,增强现有ZSL框架的性能。

实验结果

研究问题

  • RQ1在零样本学习设置下,能否利用语义表示来预测未见类别的视觉样本(聚类中心)?
  • RQ2建模语义嵌入与视觉样本之间的结构化关系,如何提升零样本学习的泛化能力?
  • RQ3在ImageNet等大规模基准上,所提出的基于核的回归器在多大程度上优于现有ZSL方法?
  • RQ4当特征维度降低或使用预测样本而非真实样本时,该方法是否仍保持鲁棒性?
  • RQ5在不同随机采样策略下,该方法的性能是否稳定?

主要发现

  • 所提出方法在包含超过20,000个未见类别的ImageNet数据集上实现了最先进性能,显著优于先前方法。
  • 在AwA、CUB和SUN数据集上,即使视觉特征被降维至50维,该方法仍保持强劲性能,优于所有基线方法。
  • 在使用预测样本时,该方法在ImageNet上对1,000个被观察的未见类别的Flat Hit@10达到15.6%,与使用真实样本的性能相当。
  • 在10轮不同随机子集选择中的标准差较小,表明该方法在不同随机采样策略下具有高度稳定性。
  • 不同随机选择策略之间的性能差距远大于随机性带来的方差,表明被观察类别的分布比具体选择更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。