Skip to main content
QUICK REVIEW

[论文解读] Joint Dictionaries for Zero-Shot Learning

Soheil Kolouri, Mohammad Rostami|arXiv (Cornell University)|Sep 12, 2017
Domain Adaptation and Few-Shot Learning参考文献 36被引用 3
一句话总结

本文提出了一种用于零样本学习的联合词典方法(JDZSL),这是一种新颖的方法,通过共享稀疏编码联合学习视觉词典和属性词典,以缓解零样本分类中的域偏移和中心度问题。通过引入熵正则化和归纳标签传播方案,JDZSL在AWA、SUN和CUB200-2011数据集上实现了最先进或具有竞争力的性能,显著提升了基线方法的零样本分类准确率。

ABSTRACT

A classic approach toward zero-shot learning (ZSL) is to map the input domain to a set of semantically meaningful attributes that could be used later on to classify unseen classes of data (e.g. visual data). In this paper, we propose to learn a visual feature dictionary that has semantically meaningful atoms. Such dictionary is learned via joint dictionary learning for the visual domain and the attribute domain, while enforcing the same sparse coding for both dictionaries. Our novel attribute aware formulation provides an algorithmic solution to the domain shift/hubness problem in ZSL. Upon learning the joint dictionaries, images from unseen classes can be mapped into the attribute space by finding the attribute aware joint sparse representation using solely the visual data. We demonstrate that our approach provides superior or comparable performance to that of the state of the art on benchmark datasets.

研究动机与目标

  • 通过更稳健地建模视觉特征与语义属性之间的关系,解决零样本学习(ZSL)中的域偏移和中心度问题。
  • 通过联合稀疏编码学习语义上有意义的视觉词典和属性词典,提升零样本分类的准确率。
  • 通过在不同领域间保持稀疏表示的一致性,减少已见类与未见类之间的分布差异。
  • 通过归纳学习方案传播预测属性上的标签,减轻中心度问题,从而提升性能。
  • 提出一种统一的、属性感知的联合词典学习公式,其在标准基准测试中优于现有ZSL方法。

提出的方法

  • 该方法将零样本学习建模为联合词典学习问题,通过共享稀疏编码约束,同时训练视觉词典和属性词典。
  • 在优化过程中引入熵正则化项,以鼓励分布均衡且有意义的稀疏编码,减少域偏移并改善属性聚类。
  • 该方法在预测属性的图结构上执行归纳标签传播步骤,以优化预测结果并缓解嵌入空间中的中心度问题。
  • 模型利用VGG19提取图像特征,属性则采用人工标注或word2vec生成,参数通过k折交叉验证进行调优。
  • 联合词典学习框架通过交替最小化进行优化,结合了稀疏性、一致性和熵正则化项。
  • 对未见类别的最终预测通过仅使用视觉特征计算测试图像的属性感知联合稀疏表示得出。

实验结果

研究问题

  • RQ1通过共享稀疏编码的联合词典学习是否能通过减少已见类与未见类之间的域偏移来提升零样本分类性能?
  • RQ2在稀疏编码过程中引入熵正则化如何影响语义属性的聚类质量和泛化能力?
  • RQ3在预测属性上执行的归纳标签传播步骤在多大程度上能缓解零样本学习中的中心度问题?
  • RQ4所提出的属性感知联合词典学习框架是否在多样化的零样本基准上实现了最先进性能?
  • RQ5当使用相同的视觉特征和属性时,该方法与现有ZSL方法相比表现如何?

主要发现

  • 带有熵正则化的AAw公式显著改善了属性聚类并减少了域偏移,如图2中更清晰的t-SNE可视化结果所示。
  • 归纳标签传播步骤(TAA公式)进一步通过缓解中心度问题提升了分类准确率,尤其在与AAw公式结合时效果更显著。
  • JDZSL在AWA、SUN和CUB200-2011数据集上实现了最先进或具有竞争力的hit@1准确率,优于或匹配了近期最先进方法。
  • 该方法在多样化的零样本识别任务(包括物体识别和场景识别)中表现出一致的性能,表明其具有强大的泛化能力。
  • 消融实验证实,熵正则化和归纳标签传播均为关键组件,二者结合可带来最高的性能提升。
  • 该方法在所有三个基准数据集上均保持了强劲性能,表明其对属性和特征在不同数据集上的差异具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。