Skip to main content
QUICK REVIEW

[论文解读] On Initial Pools for Deep Active Learning

Akshay L Chandra, Sai Vikas Desai|arXiv (Cornell University)|Nov 30, 2020
Machine Learning and Algorithms参考文献 30被引用 6
一句话总结

本文研究了是否可以通过自监督学习(SimCLR、SCAN)或聚类(K-Means)方法智能采样初始池,来提升深度主动学习(DAL)的性能,相较于随机初始化。尽管大多数方法未表现出一致的改进,但基于变分自编码器(VAE)的初始池在多个数据集和查询策略下均取得了微小但稳定的增益,表明对难以重构样本进行生成建模,可能有助于在低数据场景下的泛化能力。

ABSTRACT

Active Learning (AL) techniques aim to minimize the training data required to train a model for a given task. Pool-based AL techniques start with a small initial labeled pool and then iteratively pick batches of the most informative samples for labeling. Generally, the initial pool is sampled randomly and labeled to seed the AL iterations. While recent studies have focused on evaluating the robustness of various query functions in AL, little to no attention has been given to the design of the initial labeled pool for deep active learning. Given the recent successes of learning representations in self-supervised/unsupervised ways, we study if an intelligently sampled initial labeled pool can improve deep AL performance. We investigate the effect of intelligently sampled initial labeled pools, including the use of self-supervised and unsupervised strategies, on deep AL methods. The setup, hypotheses, methodology, and implementation details were evaluated by peer review before experiments were conducted. Experimental results could not conclusively prove that intelligently sampled initial pools are better for AL than random initial pools in the long run, although a Variational Autoencoder-based initial pool sampling strategy showed interesting trends that merit deeper investigation.

研究动机与目标

  • 探究非随机、智能设计的初始标注池是否能相较于标准随机采样,提升深度主动学习(DAL)的性能。
  • 评估自监督表示学习(SimCLR、SCAN)和基于聚类的采样方法对DAL效率和模型泛化能力的影响。
  • 确定初始池设计是否会影响长期模型性能,尤其是在数据稀缺以及类别不平衡等现实约束条件下。
  • 探索无监督或自监督方法是否能在不增加标注成本的前提下,减少数据集构建中的标注成本。
  • 评估是否初始池中包含多样化或具有挑战性的样本(例如VAE中高重建损失的样本)能带来更好的下游主动学习结果。

提出的方法

  • 提出一种基于VAE的初始池采样策略,通过选择重建损失较高的样本,假设这些样本更具信息量或代表性。
  • 采用基于聚类的采样方法(K-Means),通过从每个聚类中等比例采样,确保类别覆盖,提升初始池的多样性。
  • 利用先进的自监督模型(SimCLR和SCAN)对未标注数据进行嵌入,并通过模型损失识别困难样本,形成另一种初始池采样策略。
  • 将这些初始池集成到标准池-based主动学习流程中,采用多种查询策略:不确定性采样(LC)、基于熵的不确定性采样(ME),以及深度贝叶斯主动学习(DBAL)。
  • 使用修改后的ResNet18模型,加入投影头以进行自监督预训练,并在DBAL实验中引入Dropout以实现蒙特卡洛Dropout。
  • 在MNIST、CIFAR-10、CIFAR-100和Tiny ImageNet上进行实验,采用标准化的超参数和正则化设置,以确保公平比较。

实验结果

研究问题

  • RQ1基于池的深度主动学习方法是否能从智能采样的初始池中受益,而非依赖随机采样?
  • RQ2自监督学习技术(如SimCLR、SCAN)是否可用于识别信息量高的样本以实现初始池选择,而无需额外标注?
  • RQ3基于聚类的采样策略若能确保初始池中的类别平衡,是否能提升深度主动学习中的泛化能力?
  • RQ4与随机采样或其他自监督策略相比,使用基于VAE的初始池是否能在主动学习中带来可测量的性能提升?
  • RQ5在数据稀缺和类别不平衡条件下,初始池策略的性能在多个主动学习周期中如何演变?

主要发现

  • 基于VAE的初始池采样策略在CIFAR-100上始终优于随机初始池,在CIFAR-10上也表现出微小但积极的增益,尤其在低预算设置下。
  • 基于SCAN和K-Means的初始池未提升性能,甚至在某些情况下劣于随机采样,尤其在长尾和类别不平衡设置下。
  • 在长尾CIFAR-10设置下,基于VAE的初始池在多种查询策略下均表现出微小但一致的性能优势。
  • 在低预算CIFAR-10上的消融实验表明,VAE采样的初始池能加快早期主动学习周期的收敛速度,并降低泛化误差。
  • 尽管SimCLR和SCAN在自监督表示学习中表现优异,但其用于初始池选择并未转化为更好的主动学习结果。
  • 基于VAE的池带来的微小增益表明,重建难度可能与样本的信息量相关,但随着标注池规模增大,该效应逐渐减弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。