Skip to main content
QUICK REVIEW

[论文解读] A Comparative Survey of Deep Active Learning

Xueying Zhan, Qingzhong Wang|arXiv (Cornell University)|Mar 25, 2022
Machine Learning and Algorithms被引用 48
一句话总结

本文通过在 DeepAL+ 工具包中重新实现 19 种高度引用的 DAL 方法,进行全面的跨数据集比较,并分析批量大小、训练周期等因素,以指导公平、有效的 DAL 实验。

ABSTRACT

While deep learning (DL) is data-hungry and usually relies on extensive labeled data to deliver good performance, Active Learning (AL) reduces labeling costs by selecting a small proportion of samples from unlabeled data for labeling and training. Therefore, Deep Active Learning (DAL) has risen as a feasible solution for maximizing model performance under a limited labeling cost/budget in recent years. Although abundant methods of DAL have been developed and various literature reviews conducted, the performance evaluation of DAL methods under fair comparison settings is not yet available. Our work intends to fill this gap. In this work, We construct a DAL toolkit, DeepAL+, by re-implementing 19 highly-cited DAL methods. We survey and categorize DAL-related works and construct comparative experiments across frequently used datasets and DAL algorithms. Additionally, we explore some factors (e.g., batch size, number of epochs in the training process) that influence the efficacy of DAL, which provides better references for researchers to design their DAL experiments or carry out DAL-related applications.

研究动机与目标

  • 在标注预算下,推动对 Deep Active Learning (DAL) 方法的公平且全面评估。
  • 通过在 DeepAL+ 中重新实现领先的 DAL 方法,提供一个可复现的 DAL 基准评估平台。
  • 通过查询策略(不确定性、代表性/多样性、综合)与增强技术来调查 DAL 方法。
  • 评估训练设置(批量大小、训练轮次)以及数据/模型增强对不同任务中 DAL 性能的影响。
  • 提供设计公平 DAL 实验的指南,并指出挑战与未来研究方向。

提出的方法

  • 在 DeepAL+ 工具包中重新实现 19 种高度引用的 DAL 方法。
  • 基于池的主动学习公式化,带标记集 LC 与未标记池 LU。
  • 以常见骨干网络(如 ResNet18)进行的分类任务,以确保公平比较。
  • 将查询策略分为基于不确定性、基于代表性/多样性以及综合方法。
  • 在多个数据集上评估(例如 MNIST、FashionMNIST、EMNIST、SVHN、CIFAR 变体、TinyImageNet、BreakHis、Pneumonia-MNIST、Waterbird)。
  • 消融研究以分析训练轮次和批量大小的影响;时间和内存考虑;以及预训练的影响。

实验结果

研究问题

  • RQ1在相同训练与预算条件下,不同 DAL 查询策略(基于不确定性、基于代表性/多样性、以及综合)如何比较?
  • RQ2训练超参数(训练轮次、批量大小)对跨任务的 DAL 性能有何影响?
  • RQ3数据/模型增强技术(伪标签、数据增强、集成、损失函数调整)是否在各数据集上一致提升 DAL 的性能?
  • RQ4预训练如何影响在具有虚假相关或语义变化的任务(如 Waterbird、MNIST)上 DAL 方法的有效性?

主要发现

  • 基于不确定性的 DAL 方法在标准图像分类任务上比 Random 的提升适中(平均约 1-3%),但没有单一方法在所有数据集上占优。
  • 两阶段和梯度基方法(如 BADGE、WAAL)在某些任务上表现具竞争力,权衡也较有利,尤其在 CIFAR100。
  • 代表性/多样性 方法(KMeans、VAAL、VAAL 变体)通常带来更高的内存/时间成本,在多个数据集上提供的收益也不如基于不确定性的方法稳定。
  • 预训练在某些情况下(如 Waterbird)通过提供更好的特征表示来提升 DAL 性能,尽管效果因数据集和任务而异。
  • 消融研究表明更多的训练轮次可在某些方法上提升性能,但收益递减;批量大小的影响具有变量性,较大批量有时会降低迭代频率带来的好处。
  • 增强型 DAL 方法(LPL、WAAL、AdvBIM、CEAL)显示潜力,但对超参数和数据集特性较为敏感,在不同任务上结果参差不齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。