[论文解读] Transductive Decoupled Variational Inference for Few-Shot Classification
TRIDENT 提出了一种归纳式、解耦的变分推理框架,用于少样本分类,将图像表征分离为语义和标签特定的潜在变量,并通过基于注意力的归纳特征提取模块(AttFEX)增强任务感知能力。该方法在 miniImageNet、tieredImageNet 以及具有挑战性的跨域 miniImageNet→CUB 设置中均实现了最先进性能,分别实现了最高 5% 和 20% 的准确率提升。
The versatility to learn from a handful of samples is the hallmark of human intelligence. Few-shot learning is an endeavour to transcend this capability down to machines. Inspired by the promise and power of probabilistic deep learning, we propose a novel variational inference network for few-shot classification (coined as TRIDENT) to decouple the representation of an image into semantic and label latent variables, and simultaneously infer them in an intertwined fashion. To induce task-awareness, as part of the inference mechanics of TRIDENT, we exploit information across both query and support images of a few-shot task using a novel built-in attention-based transductive feature extraction module (we call AttFEX). Our extensive experimental results corroborate the efficacy of TRIDENT and demonstrate that, using the simplest of backbones, it sets a new state-of-the-art in the most commonly adopted datasets miniImageNet and tieredImageNet (offering up to 4% and 5% improvements, respectively), as well as for the recent challenging cross-domain miniImagenet --> CUB scenario offering a significant margin (up to 20% improvement) beyond the best existing cross-domain baselines. Code and experimentation can be found in our GitHub repository: https://github.com/anujinho/trident
研究动机与目标
- 解决现有少样本学习方法在低数据场景下的局限性,特别是样本偏差和对未见类别的泛化能力差的问题。
- 将图像表征解耦为语义和标签特定的潜在变量,以提升分类鲁棒性并分离无关的上下文信息。
- 通过新颖的基于注意力的归纳特征提取机制,在推理过程中同时利用支持集和查询集图像,增强任务感知能力。
- 通过推断模型参数和类别原型的概率分布而非依赖点估计,提升少样本设置下的泛化能力。
- 在标准少样本基准和具有挑战性的跨域少样本场景中展示优越性能。
提出的方法
- 提出一种变分推理网络,包含两个相互交织的子网络,联合从图像中推断语义(z_s)和标签(z_l)潜在变量。
- 引入 AttFEX,一种基于注意力的归纳特征提取模块,通过融合支持集和查询集图像的特征,生成任务感知表征。
- 采用元学习框架,结合 MAML 风格的适应机制,基于任务特定的支持集更新潜在变量推理网络。
- 将后验推断解耦为两个独立的变分近似:一个用于语义内容(z_s),另一个用于判别性标签特征(z_l)。
- 在 AttFEX 中应用可微分注意力机制,动态加权少样本任务中所有图像的特征,实现跨图像比较与对齐。
- 使用变分下界(ELBO)优化模型,以鼓励准确的后验近似和任务特定的适应。
实验结果
研究问题
- RQ1将图像表征解耦为语义和标签特定的潜在变量是否能提升少样本分类性能?
- RQ2通过注意力机制整合支持集和查询集图像的归纳信息,是否能增强任务感知能力并提高分类准确率?
- RQ3一种推断潜在变量概率分布的变分推理框架,是否能在低数据少样本设置下超越基于点估计的基线方法?
- RQ4所提出方法在域偏移场景下(如从 miniImageNet 到 CUB)的泛化能力如何?
- RQ5为最大化少样本分类性能,潜在空间和特征图维度的最优配置是什么?
主要发现
- TRIDENT 在 5 类 1 样本的 miniImageNet 基准上实现了 86.11% 的新最先进准确率,相比之前最先进方法最高提升 5%。
- 在 tieredImageNet 上,TRIDENT 相较于现有基线实现了 5% 的性能提升,表明其在标准少样本基准上具有强大泛化能力。
- 在具有挑战性的跨域设置(miniImageNet → CUB)中,TRIDENT 相较于最佳现有基线实现了 20% 的相对性能提升,凸显其对域偏移的鲁棒性。
- 消融实验表明,z_l 和 z_s 的最优潜在维度为 (64, 64),超过此点性能开始下降。
- 当查询特征图维度(W_M)超过支持集维度(W_N)时,AttFEX 显著提升性能,其中 (64, 32) 配置表现最佳。
- 使用 UMAP 和 Davies-Bouldin 评分的定性分析表明,经过元适应后,标签潜在空间(z_l)的类别分离和聚类效果显著优于语义空间(z_s)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。