Skip to main content
QUICK REVIEW

[论文解读] Transductive Zero-Shot Learning with a Self-training dictionary approach

Yunlong Yu, Zhong Ji|arXiv (Cornell University)|Mar 27, 2017
Domain Adaptation and Few-Shot Learning参考文献 30被引用 5
一句话总结

本文提出了一种归纳零样本学习方法 TSTD,通过在可靠未见实例上迭代地使用自训练策略来改进泛化能力。通过使用双向词典模型将图像特征和标签嵌入联合投影到共享潜在空间,减少语义鸿沟和域偏移,在使用视觉属性的情况下,于 AwA(90.3%)和 CUB(58.2%)数据集上实现了最先进性能。

ABSTRACT

As an important and challenging problem in computer vision, zero-shot learning (ZSL) aims at automatically recognizing the instances from unseen object classes without training data. To address this problem, ZSL is usually carried out in the following two aspects: 1) capturing the domain distribution connections between seen classes data and unseen classes data; and 2) modeling the semantic interactions between the image feature space and the label embedding space. Motivated by these observations, we propose a bidirectional mapping based semantic relationship modeling scheme that seeks for crossmodal knowledge transfer by simultaneously projecting the image features and label embeddings into a common latent space. Namely, we have a bidirectional connection relationship that takes place from the image feature space to the latent space as well as from the label embedding space to the latent space. To deal with the domain shift problem, we further present a transductive learning approach that formulates the class prediction problem in an iterative refining process, where the object classification capacity is progressively reinforced through bootstrapping-based model updating over highly reliable instances. Experimental results on three benchmark datasets (AwA, CUB and SUN) demonstrate the effectiveness of the proposed approach against the state-of-the-art approaches.

研究动机与目标

  • 解决零样本学习(ZSL)中的域偏移问题,即在已见类别上训练的模型无法泛化到未见类别。
  • 通过学习共享潜在空间,改善图像特征与语义标签嵌入之间的跨模态对齐。
  • 通过迭代地利用可靠自标注的未见实例来优化预测,克服静态、噪声大且稀疏的标签嵌入的局限性。
  • 开发一种归纳框架,通过基于自举的再训练方式,在高置信度预测的基础上增强模型容量。
  • 通过结合双向语义建模与迭代自训练,实现在基准 ZSL 数据集上的最先进性能。

提出的方法

  • 提出一种双向词典模型,可同时将图像特征与标签嵌入投影到共同潜在空间,以保留跨模态语义关系。
  • 将 ZSL 问题形式化为一种归纳学习任务,利用未标记的未见实例来迭代优化模型。
  • 实施一种迭代的两阶段范式:(1) 学习预测(使用当前模型对未见数据进行分类),(2) 预测学习(使用高置信度预测结果对模型进行再训练)。
  • 使用自标注率阈值 δ 来控制用于模型再训练的高置信度预测的比例,确保仅选择可靠实例。
  • 通过基于自举的模型更新策略,逐步提升分类能力,通过在最自信的预测上强化模型。
  • 通过将自训练策略应用于现有归纳模型(如 JEDM、CCA、ESZSL)来集成该方法,以提升其性能。

实验结果

研究问题

  • RQ1能否通过一种双向词典模型,将图像特征与标签嵌入联合投影到共享潜在空间,有效减少语义鸿沟并改善零样本学习中的跨模态对齐?
  • RQ2与单次传递的归纳方法相比,基于置信度选择未标记未见实例的迭代自训练策略在多大程度上能提升模型泛化能力?
  • RQ3所提出的归纳框架在多大程度上能通过逐步利用可靠预测来优化模型,缓解零样本学习中的域偏移问题?
  • RQ4自标注率 δ 对模型性能有何影响?何种最优阈值可在不引入噪声的前提下实现性能提升?
  • RQ5所提出方法是否在标准基准数据集(如 AwA、CUB 和 SUN)上优于现有的最先进归纳 ZSL 方法?

主要发现

  • 所提出的 TSTD 方法在使用视觉属性的 AwA 数据集上实现了 90.3% 的准确率,比第二名方法高出 2.4 个百分点。
  • 在 CUB 数据集上,TSTD 使用视觉属性实现了 58.2% 的准确率,比第二好的方法高出 4.7 个百分点。
  • 在使用视觉属性时,自训练策略使基础 JEDM 模型在 AwA 上提升了 10.6 个百分点,在 CUB 上提升了 3.0 个百分点。
  • 在 AwA 上,δ = 0.8 时性能达到峰值,表明当初始预测可靠时,更高的自标注率有助于提升模型成熟度。
  • 在 CUB 上,性能峰值出现在 δ = 0.6(使用属性)和 δ = 0.4(使用词向量),表明当初始模型性能较弱时,较低的阈值更优。
  • 迭代自训练框架显著增强了归纳模型的泛化能力,表明通过高置信度预测进行渐进式优化在缓解域偏移方面是有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。