Skip to main content
QUICK REVIEW

[论文解读] Is margin all you need? An extensive empirical study of active learning on tabular data

Dara Bahri, Heinrich Jiang|arXiv (Cornell University)|Oct 7, 2022
Machine Learning and Algorithms被引用 4
一句话总结

本文在69个真实世界表格数据集上,使用深度神经网络评估了15种主动学习方法,发现尽管简单,边际采样(margin sampling)在各种数据设置和预训练配置下始终与或优于所有最先进的替代方法。主要贡献在于实证证据表明,边际采样是表格主动学习中一种稳健且无需超参数调优的基线方法。

ABSTRACT

Given a labeled training set and a collection of unlabeled data, the goal of active learning (AL) is to identify the best unlabeled points to label. In this comprehensive study, we analyze the performance of a variety of AL algorithms on deep neural networks trained on 69 real-world tabular classification datasets from the OpenML-CC18 benchmark. We consider different data regimes and the effect of self-supervised model pre-training. Surprisingly, we find that the classical margin sampling technique matches or outperforms all others, including current state-of-art, in a wide range of experimental settings. To researchers, we hope to encourage rigorous benchmarking against margin, and to practitioners facing tabular data labeling constraints that hyper-parameter-free margin may often be all they need.

研究动机与目标

  • 在多种训练设置下,对多种主动学习方法在真实世界表格数据集上的性能进行严格评估。
  • 评估现代复杂主动学习方法是否在实际设置中始终优于经典的边际采样技术。
  • 研究模型预训练、种子集大小和批量大小对主动学习性能的影响。
  • 为未来在表格数据主动学习中的研究与实际部署提供全面基准。
  • 挑战一种假设,即更复杂的主动学习方法在本质上优于简单的基于不确定性的策略。

提出的方法

  • 本研究在来自OpenML-CC18基准的69个表格数据集上,评估了15种主动学习方法,包括基于不确定性的、基于多样性的以及不确定性和多样性结合的混合方法。
  • 使用随机梯度下降训练深度神经网络模型,主动学习以固定批量大小在迭代轮次中进行。
  • 边际采样选择top-2 Softmax概率差异最小的样本,代表最高预测不确定性。
  • 通过配对t检验(p ≤ 0.1)评估测试准确率在多个采样轮次中的统计显著性。
  • 分析涵盖预训练和非预训练模型,结果在小、中、大三种数据规模下报告。
  • 使用胜场矩阵和箱线图比较相对性能,并通过可视化各数据集上相对于随机采样的相对改进程度来展示结果。

实验结果

研究问题

  • RQ1在使用深度神经网络时,边际采样是否在真实世界表格数据集上优于现代SOTA主动学习方法?
  • RQ2不同数据设置(小、中、大种子集和批量大小)如何影响主动学习方法的相对性能?
  • RQ3自监督预训练是否能提升非边际采样方法相对于边际采样的性能?
  • RQ4促进多样性的方法或不确定性和多样性结合的方法在实际设置中是否始终优于边际采样?
  • RQ5复杂方法的性能优势在广泛的数据集和配置下是否具有统计显著性?

主要发现

  • 在所有数据设置和预训练条件下,边际采样在测试准确率方面优于所有其他主动学习方法。
  • 即使在使用自监督预训练的情况下,也无任何方法在统计上显著优于边际采样。
  • 在中等规模设置下,边际采样相对于随机采样的平均相对提升为1–3%,且在所有采样轮次中均保持一致增益。
  • 如BALD和PowerBALD等方法表现不如边际采样,其中PowerBALD性能可能归因于其噪声机制模拟了随机采样。
  • 基于聚类的方法(如Cluster-Margin和TypiClust)表现与随机采样相当或更差,除非聚类大小极小(1.25),此时性能接近边际采样。
  • 即使在仅30个初始标注样本的小规模设置下,边际采样仍能持续优于随机采样,表明其在低数据设置下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。