[论文解读] Classifier and Exemplar Synthesis for Zero-Shot Learning
该论文提出了两种零样本学习框架,通过语义嵌入合成分类器和视觉样本,实现对未见类别的识别。通过基于图的流形学习建模类别间关系,并从语义向量回归生成视觉样本,该方法在五个基准数据集上实现了最先进性能,在传统和广义零样本学习设置下均表现出强泛化能力。
Zero-shot learning (ZSL) enables solving a task without the need to see its examples. In this paper, we propose two ZSL frameworks that learn to synthesize parameters for novel unseen classes. First, we propose to cast the problem of ZSL as learning manifold embeddings from graphs composed of object classes, leading to a flexible approach that synthesizes "classifiers" for the unseen classes. Then, we define an auxiliary task of synthesizing "exemplars" for the unseen classes to be used as an automatic denoising mechanism for any existing ZSL approaches or as an effective ZSL model by itself. On five visual recognition benchmark datasets, we demonstrate the superior performances of our proposed frameworks in various scenarios of both conventional and generalized ZSL. Finally, we provide valuable insights through a series of empirical analyses, among which are a comparison of semantic representations on the full ImageNet benchmark as well as a comparison of metrics used in generalized ZSL. Our code and data are publicly available at https://github.com/pujols/Zero-shot-learning-journal
研究动机与目标
- 解决在无任何标注训练样本的情况下识别未见物体类别的问题。
- 通过合成代表性参数——分类器与视觉样本——克服传统零样本学习的局限性。
- 通过学习将语义表示映射到视觉特征与分类器参数,提升零样本泛化能力。
- 提供一个统一且灵活的框架,可增强现有零样本学习方法或作为独立模型使用。
- 研究语义表示质量与样本预测对多种数据集上零样本学习性能的影响。
提出的方法
- 将零样本学习建模为图对齐问题,其中物体类别在语义空间中构成加权图,边权重由语义相似度导出。
- 学习一种流形嵌入,将视觉分类器(作为模型空间坐标)映射到语义图,从而实现对未见类别的分类器合成。
- 将视觉样本定义为已见类别平均特征的降维表示,并训练回归器从语义表示预测这些样本。
- 使用支持向量回归器(SVR)或多层感知机(MLP)将语义向量映射到视觉样本特征,采用 L2 正则化防止过拟合。
- 应用 t-SNE 可视化评估预测样本的质量,通过测量其与未见类别真实图像聚类的接近程度。
- 采用 PCA 进行特征降维,验证在不同 PCA 维度(10 至 1024)下的鲁棒性。
实验结果
研究问题
- RQ1能否通过在物体类别语义图上的流形学习合成分类器,来提升零样本泛化能力?
- RQ2从语义嵌入中合成视觉样本在提升零样本识别性能方面有多有效?
- RQ3不同回归模型(SVR 与 MLP)在样本预测准确率与零样本学习泛化能力方面有何影响?
- RQ4PCA 维度的选择如何影响样本预测与推理的性能与效率?
- RQ5语义表示质量与已见类别数量在多大程度上影响合成样本与分类器的质量?
主要发现
- SynC 框架在五个基准数据集(包括 AwA、CUB 和 ImageNet)的常规与广义零样本学习任务中均达到最先进性能。
- 在 AwA 数据集上,该方法在无 PCA 的情况下使用基于 SVR 的样本预测,达到 77.8% 的准确率,表明即使仅有 40 个已见类别,也具备强大泛化能力。
- EXEM(1NN)使用 SVR 的方法优于基于 MLP 的样本预测,在 AwA 数据集上达到 76.2% 的准确率(PCA,d=1024),表明 SVR 在小样本训练集下更具鲁棒性。
- 该方法对 PCA 维度具有高度鲁棒性,在 d=10 时仍保持 AwA 上超过 75% 和 SUN 上超过 68% 的准确率,显示出良好的可扩展性与效率。
- t-SNE 可视化结果表明,预测的样本与真实图像聚类高度对齐,尤其在 AwA 和 SUN 数据集上,验证了合成特征的质量。
- 在细粒度 CUB 数据集上,由于类别混杂,样本预测更具挑战性,但该方法仍达到 59.4% 的准确率(PCA,d=1024),优于基线 MLP 方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。