Skip to main content
QUICK REVIEW

[论文解读] Combining MixMatch and Active Learning for Better Accuracy with Fewer Labels

Shuang Song, David Berthelot|arXiv (Cornell University)|Dec 2, 2019
Machine Learning and Algorithms参考文献 24被引用 18
一句话总结

该论文将SOTA半监督学习方法MixMatch与主动学习相结合,显著提升了在较少标注样本下的准确率。通过使用不确定性采样(基于diff2不确定性度量)迭代选择最具信息量的未标注样本,所提出的MMA框架在CIFAR-10、CIFAR-100和SVHN上实现了最高达1.5%的绝对准确率提升,且标注预算大幅减少。

ABSTRACT

We propose using active learning based techniques to further improve the state-of-the-art semi-supervised learning MixMatch algorithm. We provide a thorough empirical evaluation of several active-learning and baseline methods, which successfully demonstrate a significant improvement on the benchmark CIFAR-10, CIFAR-100, and SVHN datasets (as much as 1.5% in absolute accuracy). We also provide an empirical analysis of the cost trade-off between incrementally gathering more labeled versus unlabeled data. This analysis can be used to measure the relative value of labeled/unlabeled data at different points of the learning curve, where we find that although the incremental value of labeled data can be as much as 20x that of unlabeled, it quickly diminishes to less than 3x once more than 2,000 labeled example are observed. Code can be found at https://github.com/google-research/mma.

研究动机与目标

  • 通过整合主动学习技术,提升MixMatch半监督学习算法的性能。
  • 评估不同主动学习策略(尤其是不确定性采样)与MixMatch结合时的有效性。
  • 分析在训练过程中获取额外标注数据与未标注数据之间的成本-收益权衡。
  • 确定在不同学习曲线阶段,标注数据与未标注数据的相对价值,尤其是在预算受限条件下。
  • 为现实世界中存在标注成本的半监督学习提供最优数据获取策略的实证指导。

提出的方法

  • 通过基于模型置信度的不确定性,迭代选择最具不确定性的样本进行标注,将强大的半监督学习方法MixMatch与主动学习相结合。
  • 使用diff2不确定性度量识别预测不确定性最高的未标注样本,优先进行标注。
  • 采用基于k-means的多样化策略,确保各类别代表性均衡,尤其在SVHN等类别不平衡的数据集中尤为重要。
  • 在初始小规模标注样本集上训练模型,然后每轮迭代增加50个样本,每次添加后重新训练模型。
  • 在MixMatch中应用数据增强和一致性正则化,利用标注和未标注数据提升泛化能力。
  • 通过线性插值估算在给定标注样本数量下,为达到目标准确率所需未标注样本数量,从而实现成本比率分析。

实验结果

研究问题

  • RQ1将主动学习与MixMatch结合后,在CIFAR-10、CIFAR-100和SVHN等标准基准上的模型准确率如何变化?
  • RQ2在与MixMatch结合时,不确定性采样、基于委员会的查询(query-by-committee)和随机选择这三种主动学习策略中,哪一种性能最佳?
  • RQ3在学习曲线的不同阶段,标注数据相对于未标注数据的增量价值如何?
  • RQ4在SVHN等数据集存在类别不平衡的情况下,主动学习与MixMatch结合时的性能如何受到影响?
  • RQ5相对于获取更多未标注数据,标注额外数据的边际收益在何时开始下降?

主要发现

  • MMA框架通过将MixMatch与基于diff2度量的不确定性采样结合,在CIFAR-10、CIFAR-100和SVHN上相比仅使用MixMatch的模型,最高实现1.5%的绝对准确率提升。
  • 在SVHN上,当标注预算为4000时,MMA达到97.39%的准确率,仅比完整训练集的准确率(97.41%)低0.02%,但仅使用了约18.31倍的更少标注样本。
  • 基于k-means的多样化方法优于直接选择,表明类别均衡采样能提升性能,尤其在类别不平衡的数据集中效果更显著。
  • 当标注样本数超过2000个后,标注与获取未标注数据的成本比率从峰值20倍降至3倍以下,表明标注的边际收益显著下降。
  • 在SVHN上,成本比率偶尔低于0,表明在此阶段未标注数据始终比标注数据更有价值,可能是因为违反了|L| ≪ |U|的假设。
  • 分析表明,从极小规模标注集开始时,标注数据最具价值,且在超过2000个标注样本后,其边际收益迅速下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。