[论文解读] One-Shot Learning using Mixture of Variational Autoencoders: a Generalization Learning approach
该论文提出MoVAE,一种新颖的少样本学习方法,通过使用变分自编码器的混合模型,从零知识和无标签数据中学习泛化能力,在MNIST、Fashion-MNIST和Omniglot数据集上达到最先进性能,5-shot设置下准确率最高达43%,在具有挑战性的1623类1-shot分类任务中准确率为27.8%,比随机猜测高出463倍。
Deep learning, even if it is very successful nowadays, traditionally needs very large amounts of labeled data to perform excellent on the classification task. In an attempt to solve this problem, the one-shot learning paradigm, which makes use of just one labeled sample per class and prior knowledge, becomes increasingly important. In this paper, we propose a new one-shot learning method, dubbed MoVAE (Mixture of Variational AutoEncoders), to perform classification. Complementary to prior studies, MoVAE represents a shift of paradigm in comparison with the usual one-shot learning methods, as it does not use any prior knowledge. Instead, it starts from zero knowledge and one labeled sample per class. Afterward, by using unlabeled data and the generalization learning concept (in a way, more as humans do), it is capable to gradually improve by itself its performance. Even more, if there are no unlabeled data available MoVAE can still perform well in one-shot learning classification. We demonstrate empirically the efficiency of our proposed approach on three datasets, i.e. the handwritten digits (MNIST), fashion products (Fashion-MNIST), and handwritten characters (Omniglot), showing that MoVAE outperforms state-of-the-art one-shot learning algorithms.
研究动机与目标
- 解决现有少样本学习方法依赖先验知识或大量无标签数据的局限性。
- 开发一种从零知识和每类一个标注样本出发的方法,通过无标签数据学习泛化能力。
- 证明使用多个VAE的集体智能方法可超越现有最先进少样本学习模型。
- 在多样且具有挑战性的基准上评估性能,包括Omniglot数据集中此前未报告的1623类分类任务。
- 确立MoVAE作为真实世界应用中标签数据稀缺且无先验知识场景下的可行替代方案。
提出的方法
- MoVAE是基于类别特定的变分自编码器(VAE)的混合模型,每个VAE从单个标注样本学习对应类别的潜在分布。
- 该模型采用泛化学习策略——通过利用无标签数据逐步提升性能,且无需依赖先验知识。
- 分类通过计算测试样本在每个类别特定VAE下的似然概率,并选择得分最高的类别完成。
- 该方法未使用度量学习、孪生网络或记忆增强网络,与以往少样本学习方法在根本上不同。
- 通过随机梯度下降在每个VAE的变分下界(ELBO)目标上进行端到端训练。
- 即使在无无标签数据的情况下,该框架依然稳健,仅依赖每类一个标注样本和VAE的生成建模能力。
实验结果
研究问题
- RQ1一个少样本学习模型是否能在不依赖先验知识或大规模预训练的情况下实现高性能?
- RQ2使用多个VAE的集体智能方法在从每类一个标注样本中学习泛化能力方面有多有效?
- RQ3MoVAE在高度复杂的少样本任务(如Omniglot中的1623类分类)中的表现如何?
- RQ4在无无标签数据的低数据场景下,MoVAE与kNN及其他最先进方法相比表现如何?
- RQ5MoVAE能否在真实世界场景(如时尚产品分类)中实现有效泛化,且仅需极少监督?
主要发现
- 在1-shot MNIST基准上,MoVAE达到72.1%的准确率,比最先进方法高出超过25个百分点。
- 在更复杂的Fashion-MNIST数据集上,MoVAE仅用每类一个标注样本即达到60%以上的准确率,展示了在真实世界设置中的强大泛化能力。
- 在Omniglot上首次提出的1623类1-shot分类任务中,MoVAE达到27.8%的准确率——比随机猜测(0.06%)高463倍,且比kNN高9倍。
- 在Omniglot的5-shot设置中,MoVAE准确率提升至43.2%,表明其在有限标注数据下具有强大的可扩展性。
- 在所有设置中,MoVAE显著优于kNN,包括1623类任务,该任务中kNN仅达到3.1%的准确率。
- 该模型计算效率高,在标准GPU上训练完整个1623类Omniglot任务约需4小时,且推理时间快于kNN。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。