Skip to main content
QUICK REVIEW

[论文解读] Locality and compositionality in zero-shot learning

Tristan Sylvain, Linda Petrini|arXiv (Cornell University)|Dec 20, 2019
Domain Adaptation and Few-Shot Learning参考文献 55被引用 21
一句话总结

本文提出了从零开始的零样本学习(ZFS)基准,该基准排除了在ImageNet等数据集上的预训练,以隔离局部性和组合性在表征学习中的作用。结果表明,强调局部特征提取和组合结构的模型在零样本图像分类中泛化能力显著更强,且这些特性与ZSL准确率之间存在强烈相关性——尤其在CUB和AwA2等具有语义意义属性的数据集上表现明显。

ABSTRACT

In this work we study locality and compositionality in the context of learning representations for Zero Shot Learning (ZSL). In order to well-isolate the importance of these properties in learned representations, we impose the additional constraint that, differently from most recent work in ZSL, no pre-training on different datasets (e.g. ImageNet) is performed. The results of our experiments show how locality, in terms of small parts of the input, and compositionality, i.e. how well can the learned representations be expressed as a function of a smaller vocabulary, are both deeply related to generalization and motivate the focus on more local-aware models in future research directions for representation learning.

研究动机与目标

  • 通过消除在ImageNet等外部数据集上的预训练,建立更真实的零样本学习(ZSL)评估框架。
  • 探究局部性(聚焦于输入的小部分)和组合性(将表征表示为小词汇表的函数)是否为ZSL中泛化能力的关键驱动因素。
  • 在ZFS设置下评估不同表征学习方法的表现,重点关注其对局部性和组合性的隐式或显式遵循程度。
  • 提出新颖的方法与可视化工具,以探测并量化学习表征中的局部性和组合性。
  • 提供实证证据表明,基于重建的模型(如VAEs)无法捕捉零样本泛化所必需的语义结构。

提出的方法

  • 提出从零开始的零样本学习(ZFS),模型仅在目标数据集的训练集上进行训练,完全不依赖外部数据的预训练。
  • 在学习到的特征之上使用原型网络,以评估在ZFS设置下的零样本泛化性能。
  • 提出Deep InfoMax(DIM)的一种新变体,利用相同标签的其他图像的局部图像块表示作为正样本,以促进局部性和组合性特征的学习。
  • 开发一种基于互信息的新可视化技术,用于分析表征的局部属性,从而解释模型如何关注图像的不同部分。
  • 使用总表征熵(TRE)比率作为组合性的代理指标,衡量有多少表征可由一组有意义的小部分解释。
  • 将局部性代理指标(如部分占比)与组合性代理指标(如TRE比率)与多个数据集和模型族的ZSL准确率进行相关性分析。

实验结果

研究问题

  • RQ1在排除预训练的前提下,学习表征中的局部性和组合性在多大程度上能预测零样本泛化性能?
  • RQ2不同表征学习方法(监督学习、自监督学习、VAEs)在对局部性和组合性的隐式或显式遵循程度上存在哪些差异?
  • RQ3基于局部正样本的新型Deep InfoMax变体是否能在ZFS设置下提升ZSL的表征质量?
  • RQ4基于重建的模型(如VAEs)在捕捉ZSL所需语义结构方面表现如何?其失败原因是什么?
  • RQ5语义属性的有意义程度与组合性代理指标和ZSL准确率之间相关性的强弱之间存在何种关系?

主要发现

  • ZFS基准表明,强调局部性和组合性的模型在零样本图像分类中泛化能力显著更强,尤其在具有语义意义属性的数据集上表现突出。
  • 在CUB数据集上,TRE比率(组合性的代理指标)与ZSL准确率之间存在强烈的负相关性(皮尔逊相关系数 r = -0.90),表明TRE比率越低,性能越高。
  • 在AwA2上,TRE比率与ZSL准确率的相关性依然显著(r = -0.60),但弱于CUB,表明属性质量影响了该关系的强度。
  • 在SUN上,由于属性为每张图像独立且语义一致性较低,TRE比率与ZSL准确率的相关性较弱(r = -0.30),表明属性质量调节了组合性作为代理指标的有效性。
  • 对局部表征进行平均(一种显式组合性的形式)可提升CUB和AwA2上的ZSL性能,尤其当仅有少数补丁(如鸟喙、尾羽)具有语义相关性时效果更明显。
  • VAEs在部分占比与属性相似性之间无相关性,但与SSIM存在强烈负相关性,表明其关注的是像素级相似性而非语义部分,从而削弱了其在ZSL中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。