[论文解读] Task-Aware Feature Generation for Zero-Shot Compositional Learning
本文提出了一种用于零样本组合学习的任务感知特征生成(TFG)框架,通过基于任务描述的生成器,合成新颖属性-对象组合的图像特征。通过逐层注入任务条件噪声,TFG 提升了样本效率和泛化能力,在广义零样本组合学习基准上实现了最先进性能——准确率提升超过2倍——通过生成真实且具有判别性的特征分布,使分类器在无需真实图像的情况下也能实现高精度训练。
Visual concepts (e.g., red apple, big elephant) are often semantically compositional and each element of the compositions can be reused to construct novel concepts (e.g., red elephant). Compositional feature synthesis, which generates image feature distributions exploiting the semantic compositionality, is a promising approach to sample-efficient model generalization. In this work, we propose a task-aware feature generation (TFG) framework for compositional learning, which generates features of novel visual concepts by transferring knowledge from previously seen concepts. These synthetic features are then used to train a classifier to recognize novel concepts in a zero-shot manner. Our novel TFG design injects task-conditioned noise layer-by-layer, producing task-relevant variation at each level. We find the proposed generator design improves classification accuracy and sample efficiency. Our model establishes a new state of the art on three zero-shot compositional learning (ZSCL) benchmarks, outperforming the previous discriminative models by a large margin. Our model improves the performance of the prior arts by over 2x in the generalized ZSCL setting.
研究动机与目标
- 为解决在无训练图像的情况下识别新颖视觉概念的挑战,尤其是在数据稀缺条件下。
- 通过为未见属性-对象组合合成真实图像特征,提升零样本组合学习中的模型泛化能力。
- 通过一种生成式方法,将已见组合的知识迁移至新组合,从而提升样本效率和分类器性能。
- 克服现有判别式模型的局限性,这些模型依赖于图像与文本嵌入之间的兼容性,但未建模特定模式的差异。
- 开发一种特征生成器,利用任务感知的深度采样,捕捉新颖组合下图像特征的真实分布。
提出的方法
- TFG 框架由任务感知特征生成器、判别器和分类器组成,采用端到端训练。
- 生成器基于属性-对象组合的词嵌入条件生成合成特征,采用在每层注入噪声的任务感知深度采样方法。
- 任务条件噪声逐层逐步引入,以建模任务特定的差异并提升特征分布的真实性。
- 判别器用于区分真实特征与已见组合的合成特征,从而提升生成特征的真实性。
- 分类器仅在合成特征上进行训练,以识别已见和新颖组合,实现零样本推理。
- 模型采用类似 GAN 的训练目标,其中生成器最小化判别器区分真实与合成特征的能力。
实验结果
研究问题
- RQ1生成模型能否在无真实训练图像的情况下,有效合成新颖视觉组合的图像特征?
- RQ2与单层噪声注入相比,多层注入任务条件噪声是否能提升特征质量和下游分类准确率?
- RQ3在零样本组合学习中,特别是广义 ZSCL 设置下,所提出的 TFG 框架是否能比判别式模型实现更好的泛化性能?
- RQ4生成的特征在多大程度上匹配真实图像特征的分布?它们是否为不同组合形成可分的聚类?
- RQ5任务感知深度采样对样本效率和特征生成收敛速度有何影响?
主要发现
- TFG 模型在三个 ZSCL 基准(MIT-States、UT-Zap50K 和 StanfordVRD)上达到了新的 SOTA 性能。
- 在 Purushwalkam 等人引入的广义 ZSCL 基准上,TFG 的准确率相比之前最先进方法提升超过 2 倍。
- 特征可视化显示,生成的特征与真实特征分布高度一致,且聚类更清晰、更具可分性,优于真实特征。
- t-SNE 可视化表明,与无条件噪声相比,任务感知噪声注入策略能更优地根据任务身份对噪声进行聚类。
- 消融实验确认 TFG 同时提升了预测准确率和样本效率,且训练收敛速度更快。
- 定性结果表明,分类器能以高置信度检索出匹配新颖组合的图像,尽管在复杂数据集(如 StanfordVRD)上仍存在部分失败案例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。