[论文解读] GALAXY: Graph-based Active Learning at the Extreme
GALAXY 是一种基于图的主动学习方法,通过基于二分查找的不确定性评分排序和标签多样性,自适应地选择不确定但类别平衡的样本,以解决极端类别不平衡问题。在极不平衡的视觉基准测试中,GALAXY 相较于最先进方法,将标签查询次数减少了高达30%,同时显著提升了平衡准确率。
Active learning is a label-efficient approach to train highly effective models while interactively selecting only small subsets of unlabelled data for labelling and training. In "open world" settings, the classes of interest can make up a small fraction of the overall dataset -- most of the data may be viewed as an out-of-distribution or irrelevant class. This leads to extreme class-imbalance, and our theory and methods focus on this core issue. We propose a new strategy for active learning called GALAXY (Graph-based Active Learning At the eXtrEme), which blends ideas from graph-based active learning and deep learning. GALAXY automatically and adaptively selects more class-balanced examples for labeling than most other methods for active learning. Our theory shows that GALAXY performs a refined form of uncertainty sampling that gathers a much more class-balanced dataset than vanilla uncertainty sampling. Experimentally, we demonstrate GALAXY's superiority over existing state-of-art deep active learning algorithms in unbalanced vision classification settings generated from popular datasets.
研究动机与目标
- 解决主动学习中极端类别不平衡的挑战,其中少数类样本稀少,而标准方法倾向于选择多数类样本。
- 开发一种可扩展、高效的主动学习算法,在标签选择过程中保持类别平衡,且无需事先了解类别分布。
- 确保所选样本既具有不确定性,又能代表多样化的类别,即使整体数据集严重倾斜。
- 提供理论依据,证明 GALAXY 在类别平衡方面优于标准不确定性采样。
提出的方法
- GALAXY 按 softmax 不确定性评分对未标注样本进行排序,并应用二分查找过程,识别出标签不同的连续样本对,以促进标签多样性。
- 它基于深度特征构建图,并利用模型预测结果,引导选择不确定但类别多样的样本。
- 该算法在每次模型微调后动态重建图,以适应更新的预测结果,从而随时间推移不断提升选择质量。
- 它将不确定性采样与基于图的多样性相结合,聚焦于跨多个类别边界附近的不确定点。
- 该方法采用批量选择策略,平衡不确定性和标签多样性,避免对同一类别重复查询。
- 它对标准不确定性采样流程的修改极少,易于实现和部署。
实验结果
研究问题
- RQ1当数据集中存在极端类别不平衡(如少数类与多数类比例为1:99)时,主动学习方法能否有效选择信息量丰富的样本?
- RQ2与标准不确定性采样相比,基于图的方法是否能在深度主动学习中提升所选批次的类别平衡性?
- RQ3在类别不平衡条件下,GALAXY 与现有混合不确定性-多样性方法(如 BADGE、BAIT 和 SIMILAR)相比,在标签效率和准确率方面表现如何?
- RQ4与静态图方法(如 S²)相比,GALAXY 中的动态图构建在多大程度上提升了选择质量?
- RQ5GALAXY 是否能在不同数据集和不同批量大小下保持高性能,同时减少所需标签数量?
主要发现
- 与第二好的方法相比,GALAXY 将标签查询次数减少了高达30%,在类别不平衡的 SVHN(2个类别)和 CIFAR-100(3个类别)中实现了相同的平衡准确率。
- 在类别不平衡的 SVHN(2个类别)中,GALAXY 仅用1,700次查询即达到92%的平衡准确率,而次优方法需要2,500次查询。
- 在类别不平衡的 CIFAR-100(3个类别)中,GALAXY 用1,600次查询达到66%的平衡准确率,优于第二好的方法(后者需2,200次查询)。
- GALAXY 收集的分布内标签数量显著多于基线方法,包括不确定性采样和 Most Likely Positive 方法,后者更注重确定性而非不确定性。
- 该方法在使用1-最近邻和神经网络模型时,均优于 S²,证明了基于更新模型预测结果的动态图构建的重要性。
- 实验表明,GALAXY 在全部8个测试设置中均保持卓越性能,包括在 CIFAR-100(10个类别)中使用大预算设置(批量大小为1,000)的场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。