[论文解读] Generative Multi-Label Zero-Shot Learning
本文提出了一种新颖的生成式多标签零样本学习(ML-ZSL)方法,采用跨层级特征融合(CLF)从多标签类别嵌入中合成语义一致的视觉特征。通过结合属性层级与特征层级的融合,CLF增强了标签依赖关系建模与类别特定判别能力,使在NUS-WIDE、Open Images和MS COCO基准上,广义零样本学习与零样本目标检测任务均达到当前最优性能。
Multi-label zero-shot learning strives to classify images into multiple unseen categories for which no data is available during training. The test samples can additionally contain seen categories in the generalized variant. Existing approaches rely on learning either shared or label-specific attention from the seen classes. Nevertheless, computing reliable attention maps for unseen classes during inference in a multi-label setting is still a challenge. In contrast, state-of-the-art single-label generative adversarial network (GAN) based approaches learn to directly synthesize the class-specific visual features from the corresponding class attribute embeddings. However, synthesizing multi-label features from GANs is still unexplored in the context of zero-shot setting. In this work, we introduce different fusion approaches at the attribute-level, feature-level and cross-level (across attribute and feature-levels) for synthesizing multi-label features from their corresponding multi-label class embedding. To the best of our knowledge, our work is the first to tackle the problem of multi-label feature synthesis in the (generalized) zero-shot setting. Comprehensive experiments are performed on three zero-shot image classification benchmarks: NUS-WIDE, Open Images and MS COCO. Our cross-level fusion-based generative approach outperforms the state-of-the-art on all three datasets. Furthermore, we show the generalization capabilities of our fusion approach in the zero-shot detection task on MS COCO, achieving favorable performance against existing methods. The source code is available at https://github.com/akshitac8/Generative_MLZSL.
研究动机与目标
- 为解决在零样本学习中,对未见类别缺乏训练样本的情况下,从未见类别嵌入中合成多标签视觉特征的挑战。
- 克服现有方法依赖注意力机制或单标签特征合成的局限性,这些方法在多标签场景下无法有效建模标签相关性与类别特定细节。
- 设计一个统一的生成式框架,在属性、特征与跨层级等多个层次融合多标签信息,以提升特征质量与分类准确率。
- 在多标签零样本分类与零样本目标检测两个任务上评估所提方法,验证其在不同任务与基准上的泛化能力。
- 建立基于属性与特征表示跨层级融合的生成式多标签零样本学习新SOTA基线。
提出的方法
- 提出三种融合策略:属性层级融合(ALF)、特征层级融合(FLF)与跨层级融合(CLF),其中CLF为本文主要贡献。
- 采用生成对抗网络(GAN)框架,其中生成器从类别属性嵌入中合成视觉特征,CLF通过整合ALF与FLF的双层上下文实现融合。
- 在CLF中,从类别特定嵌入生成个体类别特征,并通过双层上下文机制进行注意力聚合,该机制结合了全局(属性层级)与局部(特征层级)表示。
- 对跨层级融合生成的增强特征执行池化操作,以生成最终的多标签视觉特征表示,用于分类或检测任务。
- 将CLF生成器适配至两种生成架构:一种用于多标签分类,另一种用于零样本目标检测,均采用相同的融合机制。
- 训练生成器以学习可见类别特征的底层数据分布,使未见类别生成的特征在语义上保持一致且具备判别性。
实验结果
研究问题
- RQ1在零样本学习设置下,能否有效从多标签类别属性嵌入中合成多标签视觉特征?
- RQ2在不依赖注意力机制的前提下,如何在特征合成过程中建模多个共现类别之间的标签依赖关系?
- RQ3将属性层级与特征层级融合相结合,是否能同时提升类别特定判别能力与多标签相关性建模能力?
- RQ4基于CLF的生成式方法能否泛化至零样本目标检测任务,并在未见类别上实现具有竞争力的性能?
- RQ5相较于独立的属性层级或特征层级融合,跨层级融合在多标签零样本分类与检测任务中是否更具有效性?
主要发现
- 所提出的跨层级融合(CLF)方法在三个主要基准(NUS-WIDE、Open Images与MS COCO)上均优于当前最优方法,实现了广义零样本学习的SOTA性能。
- CLF在性能上持续优于属性层级融合(ALF)与特征层级融合(FLF),在多标签分类中降低误报率并提升真正例率。
- CLF正确预测了ALF与FLF遗漏的类别,如‘Sky’、‘Clouds’、‘Coral’与‘Mountains’,表明其在标签相关性建模方面更具优势。
- 该方法在MS COCO上的零样本目标检测任务中表现优异,能准确检测未见类别如‘snowboard’、‘airplane’、‘train’与‘cat’,且无需任何训练样本。
- CLF在标准多标签分类任务中也表现出色,在大规模基准上性能具有竞争力,表明其鲁棒性不仅限于零样本设置。
- 定性结果表明,CLF有效减少误报(如‘Snow’、‘Town’)并提升预测一致性,证实双层上下文融合机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。