[论文解读] Zero-Shot Learning from scratch (ZFS): leveraging local compositional representations
本文提出了从零开始的零样本学习(ZFS),这是一个新基准,禁止在ImageNet上进行预训练,迫使模型从零开始学习可泛化的表征。通过在图像块上引入辅助损失来学习局部组合表征,该方法提升了零样本准确率,其中DIM在ZFS设置下取得了最先进性能,尤其在AwA2和SUN数据集上表现突出。
Zero-shot classification is a generalization task where no instance from the target classes is seen during training. To allow for test-time transfer, each class is annotated with semantic information, commonly in the form of attributes or text descriptions. While classical zero-shot learning does not explicitly forbid using information from other datasets, the approaches that achieve the best absolute performance on image benchmarks rely on features extracted from encoders pretrained on Imagenet. This approach relies on hyper-optimized Imagenet-relevant parameters from the supervised classification setting, entangling important questions about the suitability of those parameters and how they were learned with more fundamental questions about representation learning and generalization. To remove these distractors, we propose a more challenging setting: Zero-Shot Learning from scratch (ZFS), which explicitly forbids the use of encoders fine-tuned on other datasets. Our analysis on this setting highlights the importance of local information, and compositional representations.
研究动机与目标
- 为解决零样本学习中对ImageNet预训练特征的过度依赖问题,该问题掩盖了对泛化本质的理解。
- 通过禁止在外部数据集上进行预训练,仅依赖目标数据集的训练划分,建立更严格的评估框架。
- 探究在无预训练条件下,局部和组合表征是否对零样本泛化至关重要。
- 评估在ZFS设置下,辅助局部损失(基于标签和属性)在提升特征学习方面的有效性。
- 为评估模型在现实世界中面对未见类别时的泛化能力,提供一个更公平的基准。
提出的方法
- 提出零样本学习从零开始(ZFS)的训练协议,完全排除在ImageNet等外部数据集上的预训练。
- 使用更小的、非预训练的编码器(如基于DCGAN、AlexNet的模型),直接从目标数据集的训练划分中学习特征。
- 通过提取中间层(如第三层)的特征引入局部目标,以促进局部表征学习。
- 在局部图像块上应用辅助损失:一种基于类别标签(LC),另一种基于语义属性(AC),以促进组合泛化。
- 在固定编码器特征之上训练原型网络,以评估零样本分类性能。
- 采用标准训练协议:使用Adam优化器,将图像调整为128×128大小,训练时使用随机裁剪,推理时使用中心裁剪。
实验结果
研究问题
- RQ1在不依赖ImageNet预训练特征的情况下,模型能否实现强大的零样本泛化性能?
- RQ2在从零开始的训练范式下,局部和组合表征如何促进零样本泛化?
- RQ3在ZFS设置下,基于标签的辅助损失与基于属性的辅助损失,哪种表现更优?
- RQ4在ZFS设置下,编码器架构的选择(如DCGAN与AlexNet)是否会影响性能?
- RQ5像DIM这样天然强调局部性的模型,是否能在ZFS基准中超越其他模型?
主要发现
- 在所有模型和数据集上,添加局部辅助损失均能持续提升Top-1准确率,证实了局部表征的重要性。
- 在CUB数据集上,使用基于属性的局部损失的DIM模型达到42.55%的Top-1准确率,优于完全监督的全连接(FC)基线。
- 在AwA2数据集上,使用基于属性的局部损失的DIM模型达到43.62%的Top-1准确率,显著超过FC基线和其他模型。
- 在SUN数据集上,使用基于属性的局部损失的DIM模型达到34.38%的Top-1准确率,展现出在ZFS设置下的强大泛化能力。
- 在VAE和AAE等模型中,基于标签的局部损失表现优于基于属性的损失,但DIM的情况相反,表明其对组合学习具有高度敏感性。
- 结果验证了在排除预训练的情况下,局部性和组合性对零样本泛化至关重要,尤其在具有挑战性的现实世界场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。