[论文解读] Multi-class Classification without Multi-class Labels
本文提出元分类学习(MCL),一种新颖的框架,仅使用成对相似性标签而非显式类别标签来训练多分类分类器。通过训练一个二分类器来预测两个样本是否属于同一类别,MCL 利用一种简单且可微的损失函数,学习到一个判别性多分类模型,在无需类别特定标注的情况下,实现了监督学习、无监督跨任务学习和半监督学习设置下的最先进或具有竞争力的性能。
This work presents a new strategy for multi-class classification that requires no class-specific labels, but instead leverages pairwise similarity between examples, which is a weaker form of annotation. The proposed method, meta classification learning, optimizes a binary classifier for pairwise similarity prediction and through this process learns a multi-class classifier as a submodule. We formulate this approach, present a probabilistic graphical model for it, and derive a surprisingly simple loss function that can be used to learn neural network-based models. We then demonstrate that this same framework generalizes to the supervised, unsupervised cross-task, and semi-supervised settings. Our method is evaluated against state of the art in all three learning paradigms and shows a superior or comparable accuracy, providing evidence that learning multi-class classification without multi-class labels is a viable learning option.
研究动机与目标
- 解决深度学习中收集多类别标签的高成本和局限性。
- 通过利用更弱的成对相似性标注,减少对显式类别标签的依赖。
- 开发一个统一的框架,支持多种学习范式——监督学习、无监督跨任务学习和半监督学习,且使用相同的底层方法。
- 证明基于成对相似性的学习足以实现有效的多分类分类。
- 为弱监督下的神经网络提供一种简单、可扩展且无需超参数的训练目标。
提出的方法
- 该方法将多分类问题形式化为元问题:学习一个二分类器,以预测两个样本是否属于同一类别。
- 引入一个概率图模型,形式化成对相似性与类别归属之间的关系。
- 从模型的似然性推导出一种简单且可微的损失函数,支持神经网络的端到端训练。
- 该框架在训练期间仅使用一个二分类器,以指导多分类器的学习,推理时则使用训练好的多分类器。
- 通过使用训练好的二分类模型对无标签数据进行伪标签预测,该方法可推广至半监督学习。
- 通过将二分类相似性模型迁移到新未知类别而无需对类别标签重新训练,支持无监督跨任务学习。
实验结果
研究问题
- RQ1是否可以在不使用任何类别特定标签的情况下,有效训练多分类分类器?
- RQ2成对相似性是否足以作为多分类中学习判别性表征的监督形式?
- RQ3基于成对相似性的统一框架是否能够支持多种学习范式,包括监督学习、半监督学习和无监督跨任务学习?
- RQ4在类别标签有限或完全缺失的设置下,所提出方法的性能与最先进方法相比如何?
- RQ5所推导损失函数在不同学习范式下的优化行为和泛化能力如何?
主要发现
- 所提出的 MCL 方法在监督学习中实现了最先进或具有竞争力的准确率,在仅提供成对标签的情况下,某些情况下甚至优于标准监督训练。
- 在无监督跨任务学习中,MCL 能够有效泛化到未知类别,展现出强大的鲁棒性和可迁移性,且无需事先了解类别身份。
- 在仅使用 4,000 个标注样本的 CIFAR-10 半监督学习设置中,Pseudo-MCL 达到了 18.0% ± 0.4% 的测试错误率,与最先进方法 VAT 的性能相当。
- 消融实验表明,联合优化二分类器和多分类器(Pseudo-MCL)显著优于静态相似性网络(SPN-MCL),后者错误率为 22.8%,凸显了端到端训练的优势。
- 该方法无需任何超参数(如边缘阈值),简化了训练过程并提升了鲁棒性,尤其在低数据场景下表现更优。
- 损失函数景观的可视化显示,MCL 目标函数表现良好,避免了尖锐极小值,表明其具有有利的优化动力学。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。