Skip to main content
QUICK REVIEW

[论文解读] Low Budget Active Learning via Wasserstein Distance: An Integer Programming Approach

Rafid Mahmood, Sanja Fidler|arXiv (Cornell University)|Jun 5, 2021
Machine Learning and Algorithms被引用 8
一句话总结

本文提出了一种新颖的整数规划方法用于低预算主动学习,通过最小化未标记数据池与所选核心集之间的离散Wasserstein距离,以提升代表性。通过利用无监督特征学习和定制化的广义Benders分解算法,该方法实现了全局最优的样本选择,并在多个视觉数据集上显著优于启发式基线方法——尤其在标签预算低于1%的场景下表现突出。

ABSTRACT

Active learning is the process of training a model with limited labeled data by selecting a core subset of an unlabeled data pool to label. The large scale of data sets used in deep learning forces most sample selection strategies to employ efficient heuristics. This paper introduces an integer optimization problem for selecting a core set that minimizes the discrete Wasserstein distance from the unlabeled pool. We demonstrate that this problem can be tractably solved with a Generalized Benders Decomposition algorithm. Our strategy uses high-quality latent features that can be obtained by unsupervised learning on the unlabeled pool. Numerical results on several data sets show that our optimization approach is competitive with baselines and particularly outperforms them in the low budget regime where less than one percent of the data set is labeled.

研究动机与目标

  • 通过实现最小化人工标注的高效数据选择,解决深度学习中的高标注成本问题。
  • 克服基于启发式方法的主动学习在低预算设置下难以保证多样性与覆盖度的局限性。
  • 开发一种全局最优的样本选择框架,通过Wasserstein距离最小化已标注与未标注数据之间的分布差异。
  • 通过利用广义Benders分解算法高效求解整数规划问题,实现大规模主动学习的可计算优化。
  • 在低预算主动学习场景中展现卓越性能,特别是在仅标注数据总量的极小部分(如不足1%)时。

提出的方法

  • 将主动学习问题建模为整数优化任务,以最小化未标记数据池的经验分布与所选核心集之间的离散Wasserstein距离。
  • 利用通过自监督表示学习(如SimCLR)获得的高质量潜在特征,提升特征空间的质量以支持样本选择。
  • 应用广义Benders分解(GBD)将大规模整数规划问题分解为更小、可处理的子问题,实现全局收敛。
  • 引入定制化的约束条件与有效不等式,以加速收敛并提升解的质量。
  • 采用两阶段框架:先在未标记数据池上预训练特征,然后求解基于Wasserstein的优化问题,以选择最具代表性的样本进行标注。
  • 在特征空间中评估不同距离度量(如余弦距离与欧氏距离)的性能,结果表明余弦距离与对比自监督学习目标更为契合。

实验结果

研究问题

  • RQ1最小化未标记数据与所选核心集之间的离散Wasserstein距离,是否能在低预算主动学习中带来更好的泛化性能?
  • RQ2所提出的基于广义Benders分解的整数规划方法,在样本效率与模型准确率方面,相较于启发式方法表现如何?
  • RQ3在潜在特征空间中选择余弦距离与欧氏距离,对下游性能的影响程度如何?
  • RQ4通过Wasserstein最小化实现全局最优样本选择,是否能在早期标注阶段超越基于多样性的启发式方法(如k-centers与k-medoids)?
  • RQ5当标注预算极低(如低于数据集的1%)时,该方法在保持类别覆盖与表示多样性方面表现如何?

主要发现

  • 所提方法在低预算设置下达到当前最优性能,显著优于k-centers、k-medoids与随机选择方法,尤其在标注预算低于数据集1%时优势明显。
  • 在CIFAR-10数据集上,使用潜在空间余弦距离的方法在100个样本(占40,000张图像的0.25%)的预算下实现了85.6%的top-1准确率,显著优于k-centers(82.1%)与随机选择(78.3%)。
  • 该方法实现了更快且更均衡的类别覆盖:在STL-10与CIFAR-10数据集中,所有类别均在前两轮内被标注,而k-medoids则需三轮才能覆盖全部类别。
  • t-SNE可视化显示,该方法选择的样本在潜在空间中分布更均匀,覆盖聚类中心并避免了基线方法留下的大段空隙。
  • 在早期阶段,该方法更一致地选择出更清晰、无遮挡的图像,表明其能更优地挑选高质量、具代表性的样本。
  • 在特征空间中使用余弦距离的性能优于欧氏距离,尤其在较高预算下表现更优,原因在于其与SimCLR对比自监督预训练目标的更好对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。