[论文解读] Stochastic Prototype Embeddings
本文提出随机原型嵌入(SPE),作为原型网络的概率扩展,将嵌入建模为高斯随机变量以捕捉少样本学习中的不确定性。通过使用高效采样器对嵌入不确定性进行边缘化,SPE在少样本和开放集分类中均优于确定性(PN)和随机性(HIB)基线方法,同时实现可解释且解耦的表示。
Supervised deep-embedding methods project inputs of a domain to a representational space in which same-class instances lie near one another and different-class instances lie far apart. We propose a probabilistic method that treats embeddings as random variables. Extending a state-of-the-art deterministic method, Prototypical Networks (Snell et al., 2017), our approach supposes the existence of a class prototype around which class instances are Gaussian distributed. The prototype posterior is a product distribution over labeled instances, and query instances are classified by marginalizing relative prototype proximity over embedding uncertainty. We describe an efficient sampler for approximate inference that allows us to train the model at roughly the same space and time cost as its deterministic sibling. Incorporating uncertainty improves performance on few-shot learning and gracefully handles label noise and out-of-distribution inputs. Compared to the state-of-the-art stochastic method, Hedged Instance Embeddings (Oh et al., 2019), we achieve superior large- and open-set classification accuracy. Our method also aligns class-discriminating features with the axes of the embedding space, yielding an interpretable, disentangled representation.
研究动机与目标
- 解决确定性深度嵌入方法在处理标签噪声、数据损坏和分布外输入时的局限性。
- 开发一种保持训练效率的同时提升少样本和开放集学习场景泛化能力的随机嵌入方法。
- 通过将类别判别性特征与嵌入空间的主轴对齐,实现可解释且解耦的表示。
- 在大规模和开放集分类任务中,超越最先进的随机方法(如Hedged Instance Embeddings, HIB)。
- 为现有随机嵌入框架提供一种可扩展、无需参数调整的替代方案,同时具备可调的不确定性建模能力。
提出的方法
- SPE将每个类别原型建模为高斯随机变量,实例嵌入以之为中心,服从独立同分布的高斯扰动。
- 通过边缘化原型接近度实现查询分类,整合支持集和查询集嵌入中的不确定性。
- 引入交集采样器以实现高效的近似后验推断,使训练计算成本接近确定性方法。
- 使用对角协方差矩阵编码不确定性,自然地使类别判别性特征与嵌入空间的主轴对齐。
- 通过将点估计替换为分布,扩展原型网络,保留相同架构但增加概率推理机制。
- 训练目标最小化后验分布下的期望分类误差,采用重参数化技巧的随机反向传播。
实验结果
研究问题
- RQ1将嵌入建模为随机变量是否能提升少样本学习中对标签噪声和数据损坏的鲁棒性?
- RQ2基于随机原型的方法是否能产生比确定性或现有随机方法更具可解释性和解耦性的表示?
- RQ3在开放集和大规模分类任务中,SPE与最先进的随机方法Hedged Instance Embeddings(HIB)相比表现如何?
- RQ4高效的采样策略是否能在保持训练效率的同时,实现在深度嵌入框架中的完整贝叶斯推断?
- RQ5不确定性建模在多大程度上增强了少样本和开放集学习中对未见类别的泛化能力?
主要发现
- SPE在少样本学习中显著优于确定性原型网络(PN),尤其在支持样本被污染时,得益于其不确定性感知推理机制。
- 在基于MNIST的$N$-digit分类任务中,SPE在所有六种条件(2≤N≤3,2≤D≤3)下均取得更高准确率,仅在24种条件中的7种表现稍逊于HIB。
- SPE在未见类别上的泛化能力优于HIB,后者无法为新类别生成有意义的嵌入,展现出更强的开放集识别能力。
- SPE的对角协方差结构导致表示解耦且可解释,类别判别性特征与主轴对齐;而HIB的表示则呈现纠缠状态。
- SPE在大规模和开放集分类基准上达到最先进性能,尽管仅使用1/3的标注数据且未进行超参数调优,仍优于HIB。
- 交集采样器使SPE的训练空间和时间成本与确定性PN相近,使其在实际部署中具备可扩展性和实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。