[论文解读] Learning Class Prototypes via Structure Alignment for Zero-Shot Recognition
本文提出了一种耦合字典学习框架,通过类别原型学习对齐视觉与语义结构,以提升零样本识别性能。通过利用判别性视觉特征来增强原本判别性较弱的语义空间,该方法学习共享且对齐的原型,从而利用简单的最近邻方法实现准确的零样本分类,在四个基准数据集上取得了最先进性能。
Zero-shot learning (ZSL) aims to recognize objects of novel classes without any training samples of specific classes, which is achieved by exploiting the semantic information and auxiliary datasets. Recently most ZSL approaches focus on learning visual-semantic embeddings to transfer knowledge from the auxiliary datasets to the novel classes. However, few works study whether the semantic information is discriminative or not for the recognition task. To tackle such problem, we propose a coupled dictionary learning approach to align the visual-semantic structures using the class prototypes, where the discriminative information lying in the visual space is utilized to improve the less discriminative semantic space. Then, zero-shot recognition can be performed in different spaces by the simple nearest neighbor approach using the learned class prototypes. Extensive experiments on four benchmark datasets show the effectiveness of the proposed approach.
研究动机与目标
- 为解决零样本学习(ZSL)中语义信息不完整且缺乏判别性的问题,该问题阻碍了对未见类别的有效识别。
- 弥合视觉空间与语义空间结构之间的不一致性,该问题常导致现有ZSL方法泛化性能差。
- 通过联合利用判别性视觉特征与丰富的语义信息来学习类别原型,以提升识别性能。
- 通过利用未见类别的语义信息进行域自适应,实现在无需新类别训练样本的情况下实现有效的零样本识别。
提出的方法
- 提出一种耦合字典学习框架,通过在共享嵌入空间中联合学习类别原型,对齐视觉与语义空间结构。
- 利用判别性视觉特征增强原本判别性较弱的语义空间,提升原型质量与识别鲁棒性。
- 引入一种结构对齐机制,强制视觉与语义类别原型之间保持一致性,确保相似类别在两个空间中均彼此接近。
- 采用基于学习到的原型的最近邻分类策略,实现在对齐空间中简单而高效的推理。
- 在训练过程中利用未见类别的语义嵌入以适应模型,减少对已见类别的过拟合。
- 应用t-SNE可视化以证明学习到的原型在类间具有良好的分离性,且能有效代表各自类别。
实验结果
研究问题
- RQ1视觉与语义空间之间的结构对齐是否能提升零样本学习中类别原型的判别性?
- RQ2利用视觉空间的判别性是否能增强语义空间本身不完整特性下的ZSL性能?
- RQ3未见类别的语义信息能否被有效用于适应学习过程,从而提升对新类别的泛化能力?
- RQ4在广义ZSL设置下,该方法在已见类与未见类之间平衡性能方面,与最先进方法相比表现如何?
主要发现
- 在AwA数据集上,该方法在广义零样本学习设置下的top-1准确率达到28.1%,优于先前最先进方法。
- 在CUB数据集上,该方法实现了34.7%的调和平均准确率,表明其在已见类与未见类之间具有出色的平衡性能。
- 在aPY数据集的未见类上,该方法实现了19.8%的top-1准确率,显著优于基线方法如DAP(4.8%)和IAP(5.7%)。
- 在广义ZSL设置下,该方法在AwA数据集上实现了40.6%的调和平均准确率,超越CMT*(15.3%)及其他最先进模型。
- 可视化结果表明,学习到的原型即使对于未见类别,也能与对应类样本良好对齐,表明其具备强大的泛化能力与判别性能。
- 通过有效利用未见类别的语义信息进行域自适应,模型显著减少了对已见类别的过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。