Skip to main content
QUICK REVIEW

[论文解读] Simple and effective localized attribute representations for zero-shot learning

Shiqi Yang, Kai Wang|arXiv (Cornell University)|Jun 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 34被引用 9
一句话总结

本文提出SELAR,一种简单而有效的零样本学习方法,通过在语义空间而非视觉空间中定位属性表征,实现性能提升。在属性空间中对1x1卷积层后的特征图应用全局最大池化(GMP),该方法在CUB和AWA2数据集上达到最先进性能,提升了泛化能力并减少了对已见类别的偏差,优于复杂的注意力机制方法。

ABSTRACT

Zero-shot learning (ZSL) aims to discriminate images from unseen classes by exploiting relations to seen classes via their semantic descriptions. Some recent papers have shown the importance of localized features together with fine-tuning the feature extractor to obtain discriminative and transferable features. However, these methods require complex attention or part detection modules to perform explicit localization in the visual space. In contrast, in this paper we propose localizing representations in the semantic/attribute space, with a simple but effective pipeline where localization is implicit. Focusing on attribute representations, we show that our method obtains state-of-the-art performance on CUB and SUN datasets, and also achieves competitive results on AWA2 dataset, outperforming generally more complex methods with explicit localization in the visual space. Our method can be implemented easily, which can be used as a new baseline for zero shot-learning. In addition, our localized representations are highly interpretable as attribute-specific heatmaps.

研究动机与目标

  • 解决零样本学习中未见类别无训练图像的挑战。
  • 减少广义零样本学习(GZSL)设置下对已见类别的固有偏差。
  • 通过在语义空间而非视觉空间中定位属性表征,提升特征的可迁移性与判别性。
  • 探究空间聚合策略对局部化属性表征性能的影响。
  • 提出一种简单、可解释且有效的零样本学习基线方法,其性能优于复杂的注意力机制方法。

提出的方法

  • 通过在投影到语义空间之前应用空间聚合(GAP或GMP),重新排序ZSL流程,实现在属性空间中的隐式定位。
  • 使用1x1卷积层将视觉特征投影到特定于属性的表征空间,生成每个属性的特征图。
  • 对这些属性图应用全局最大池化(GMP),生成紧凑且具有判别性的全局表征以用于分类。
  • 使用标准交叉熵损失进行模型训练,避免使用复杂的注意力机制或额外超参数。
  • 该方法支持微调与非微调设置,增强了对未见类别的可迁移性。
  • 生成可解释的特定于属性的热力图,显示图像中哪些区域与每个属性相关。

实验结果

研究问题

  • RQ1在语义空间中定位属性表征是否能比在视觉空间中定位带来更好的零样本学习性能?
  • RQ2像全局最大池化这样的简单空间聚合策略是否能显著提升广义零样本学习的性能?
  • RQ3聚合方法的选择(GAP与GMP)如何影响已见类与未见类准确率之间的平衡?
  • RQ4一种不使用显式注意力或部件检测模块的方法是否仍能在零样本学习中达到最先进性能?
  • RQ5所提出方法在GZSL中在多大程度上减少了对已见类别的偏差?

主要发现

  • 在CUB数据集上,SELAR在非微调设置下达到88.7%的top-1准确率,在微调设置下达到89.1%,表现达到最先进水平。
  • 在AWA2数据集上,SELAR在微调设置下达到85.6%的top-1准确率,在非微调设置下达到84.9%,优于更复杂的模型。
  • 在SUN数据集上,SELAR在微调设置下达到63.8%的top-1准确率,在非微调设置下达到62.5%,展现出强大的泛化能力。
  • SELAR-GMP在除SUN外的所有数据集上均实现了最低的已见/未见准确率比(S/U),表明对已见类别的偏差更小。
  • 在微调设置下,SELAR在CUB上的调和平均数(H)为75.6,在AWA2上为72.1,表明其在已见类与未见类性能之间具有出色的平衡。
  • 可视化结果证实,属性图中高激活区域始终与对应属性对齐,验证了方法的可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。