[论文解读] Variational Feature Disentangling for Fine-Grained Few-Shot Classification
该论文提出了一种变分特征解耦框架,用于细粒度少样本学习,将特征分离为类别判别性和类内方差分量。通过利用基础类别学习到的共享各向同性高斯分布对类内变化进行建模,该方法生成多样且逼真的数据增强,同时保留类别身份,从而在 CUB、NAB 和斯坦福狗数据集上取得最先进性能,相比之前方法最高提升 4.6%。
Fine-grained few-shot recognition often suffers from the problem of training data scarcity for novel categories.The network tends to overfit and does not generalize well to unseen classes due to insufficient training data. Many methods have been proposed to synthesize additional data to support the training. In this paper, we focus one enlarging the intra-class variance of the unseen class to improve few-shot classification performance. We assume that the distribution of intra-class variance generalizes across the base class and the novel class. Thus, the intra-class variance of the base set can be transferred to the novel set for feature augmentation. Specifically, we first model the distribution of intra-class variance on the base set via variational inference. Then the learned distribution is transferred to the novel set to generate additional features, which are used together with the original ones to train a classifier. Experimental results show a significant boost over the state-of-the-art methods on the challenging fine-grained few-shot image classification benchmarks.
研究动机与目标
- 解决细粒度少样本分类中的数据稀缺问题,其中有限的训练样本导致过拟合和泛化能力差。
- 克服现有数据增强方法存在的模式崩溃或引入无关变化的局限性。
- 确保增强样本保留类别判别性特征,同时表现出高类内多样性。
- 通过跨类别的共享类内变化建模,开发一种能从基础类别泛化到新类别的方法。
- 通过将特征解耦为判别性和方差分量,实现基于分布的有效增强,从而提升少样本分类准确率。
提出的方法
- 将图像特征解耦为两个分量:通过特征图最大池化获得的类别判别性特征 $ z_I $,以及通过变分推理建模的类内方差特征 $ z_V $。
- 使用变分自编码器(VAE)学习所有类别共享的各向同性高斯分布,以建模类内变化,该分布基于数据丰富的基础类别进行训练。
- 从学习到的 $ z_V $ 分布中多次采样,生成多样化的类内变化,将其与类别判别性特征 $ z_I $ 相加,形成增强特征。
- 使用两种监督信号进行模型训练:在 $ z_I $ 上的交叉熵分类损失,以及在 $ z_V $ 上的 VAE 重建损失,以确保特征解耦。
- 将训练好的框架应用于增强少样本支持集,通过使用相同分布为新类别生成新特征,从而在保留类别身份的同时提升多样性。
- 使用 t-SNE 可视化和聚类指标(DBI、类内/类间距离)评估生成特征的真实性和分布保真度。
实验结果
研究问题
- RQ1共享的、解耦的类内变化表示是否能提升细粒度少样本学习中的数据增强效果?
- RQ2通过使用共享各向同性高斯分布的变分自编码器建模类内方差,是否能生成更真实且多样的增强样本?
- RQ3这种解耦的特征增强方案是否能在保持类别判别性特征的同时提升类内方差?
- RQ4在聚类紧密度和类间分离度方面,生成特征的分布与真实数据相比如何?
- RQ5该方法在少样本细粒度分类中相比现有数据增强基线方法的性能提升程度如何?
主要发现
- 所提方法在 CUB 数据集上达到最先进性能,在 5-shot 设置下准确率达到 91.48%,比之前最先进方法高出 4.6 个百分点。
- 在 NAB 数据集上,该方法在 5-shot 设置下达到 95.22% 的准确率,比之前最先进方法提升 1.04%。
- 我们方法生成的特征与真实未见特征的分布高度接近,Davies–Bouldin 指数(DBI)为 2.53,接近真实数据的 3.02,显著优于其他竞争方法。
- 增强特征的类内方差(27.27)远比其他方法更接近真实数据(28.97),而 $Δ$-encoder 方法将方差降低至 10.34,表明存在分布崩溃现象。
- t-SNE 可视化结果表明,我们生成的样本位于同类别真实数据点附近,而 $Δ$-encoder 生成的新簇则偏离真实数据分布,形成孤立簇。
- 即使在增加增强样本数量时,该方法仍保持高性能,表明生成特征具有意义且非冗余。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。