Skip to main content
QUICK REVIEW

[论文解读] A Large-scale Attribute Dataset for Zero-shot Learning

Bo Zhao, Yanwei Fu|arXiv (Cornell University)|Apr 12, 2018
Domain Adaptation and Few-Shot Learning参考文献 47被引用 6
一句话总结

本文介绍了大规模属性数据集(LAD),这是一个新的零样本学习基准,包含跨五个超类(动物、水果、车辆、电子设备、发型)的230个类别共78,017张图像,标注了359个视觉、语义和主观属性。该数据集通过过滤多对象图像减少了共现偏差,支持具有挑战性的零样本学习与生成任务,表明即使是最先进的模型在细粒度、多样化的属性上仍表现不佳,尤其是在‘发型’超类中。

ABSTRACT

Zero-Shot Learning (ZSL) has attracted huge research attention over the past few years; it aims to learn the new concepts that have never been seen before. In classical ZSL algorithms, attributes are introduced as the intermediate semantic representation to realize the knowledge transfer from seen classes to unseen classes. Previous ZSL algorithms are tested on several benchmark datasets annotated with attributes. However, these datasets are defective in terms of the image distribution and attribute diversity. In addition, we argue that the "co-occurrence bias problem" of existing datasets, which is caused by the biased co-occurrence of objects, significantly hinders models from correctly learning the concept. To overcome these problems, we propose a Large-scale Attribute Dataset (LAD). Our dataset has 78,017 images of 5 super-classes, 230 classes. The image number of LAD is larger than the sum of the four most popular attribute datasets. 359 attributes of visual, semantic and subjective properties are defined and annotated in instance-level. We analyze our dataset by conducting both supervised learning and zero-shot learning tasks. Seven state-of-the-art ZSL algorithms are tested on this new dataset. The experimental results reveal the challenge of implementing zero-shot learning on our dataset.

研究动机与目标

  • 为解决现有零样本学习(ZSL)数据集在规模小、属性多样性有限以及多对象图像导致的共现偏差等方面的局限性。
  • 开发一个大规模、多样化且平衡的属性数据集,以支持跨多个视觉领域的细粒度知识迁移。
  • 通过仅收集单一前景对象的图像,减少共现偏差,特别是‘人’与‘狗’之间的虚假相关性。
  • 为在现实、复杂且细粒度的属性条件下评估ZSL和零样本生成(ZSG)算法提供新的基准。
  • 通过整合视觉属性、语义属性(如饮食、功能)以及主观属性(如安全性、人类情感)来提升ZSL模型的鲁棒性与泛化能力。

提出的方法

  • 数据集从五个超类构建:动物、水果、车辆、电子设备和发型,每个类别具有特定领域的属性。
  • 图像从多样化来源收集,并经过筛选,仅保留单对象场景,以最小化共现偏差。
  • 在实例级别标注了359个属性,包括视觉属性(如颜色、形状)、语义属性(如饮食、功能)和主观属性(如安全性、人类情感)。
  • 为每个超类设计了新颖的标签列表,以确保属性的相关性与区分度,适用于细粒度分类。
  • 使用监督学习和零样本学习协议,在LAD上评估了七种最先进的ZSL算法。
  • 针对零样本生成,使用属性向量作为条件,训练了一个条件DCGAN,以生成未见类别的新属性组合图像。

实验结果

研究问题

  • RQ1大规模、多样化且低偏差的属性数据集能否提升零样本学习模型的泛化能力与鲁棒性?
  • RQ2共现偏差(如‘人’与‘狗’频繁配对)在多大程度上会负面影响ZSL模型的性能?
  • RQ3当属性不仅包含视觉属性,还包含语义和主观属性时,细粒度类别下的零样本学习有多具挑战性?
  • RQ4最先进的ZSL模型能否在像LAD这样高度多样化且细粒度的数据集中有效泛化到未见类别?
  • RQ5条件GAN能否成功基于新颖的属性表示生成未见类别的合理图像?

主要发现

  • LAD数据集包含230个类别共78,017张图像,以及359个属性,其图像总数超过了目前最受欢迎的四个属性数据集的总和。
  • 所有七种最先进的ZSL算法在‘发型’超类中的表现均显著下降,即使仅存在六个未见类别,也表明其难度极高。
  • SOC方法(2009)在‘发型’超类中优于所有现代ZSL算法,表明当前模型可能未针对主观或细粒度属性进行优化。
  • 在AwA中,共现偏差得到实证验证:在15个动物类别中,‘人’出现在超过10%的图像中;在AwA上训练的GAN即使在真实图像中不存在‘人’的情况下,仍会生成‘人’。
  • 条件DCGAN成功生成了未见类别的合理图像(例如,同时具备‘能游泳’和‘能飞行’的属性),证明了在LAD上实现零样本生成的可行性。
  • 该数据集揭示了在存在偏差的多对象数据集上训练的模型可能学习到虚假相关性,导致在新领域中出现误分类和泛化能力差的问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。