Skip to main content
QUICK REVIEW

[论文解读] SIMILAR: Submodular Information Measures Based Active Learning In Realistic Scenarios

Suraj Kothawade, Nathan Beck|arXiv (Cornell University)|Jul 1, 2021
Machine Learning and Algorithms参考文献 45被引用 22
一句话总结

本文提出 SIMILAR,一种统一的主动学习框架,利用子模信息度量(SIM)作为获取函数,以应对类别不平衡、冗余性和分布外(OOD)数据等现实挑战。通过在分布内(ID)和分布外(OOD)数据集上进行条件化,SIMILAR 在 CIFAR-10、MNIST 和 ImageNet 上相比最先进基线方法,在罕见类别上实现最高 18% 的准确率提升,在 OOD 场景中实现 10% 的性能增益。

ABSTRACT

Active learning has proven to be useful for minimizing labeling costs by selecting the most informative samples. However, existing active learning methods do not work well in realistic scenarios such as imbalance or rare classes, out-of-distribution data in the unlabeled set, and redundancy. In this work, we propose SIMILAR (Submodular Information Measures based actIve LeARning), a unified active learning framework using recently proposed submodular information measures (SIM) as acquisition functions. We argue that SIMILAR not only works in standard active learning, but also easily extends to the realistic settings considered above and acts as a one-stop solution for active learning that is scalable to large real-world datasets. Empirically, we show that SIMILAR significantly outperforms existing active learning algorithms by as much as ~5% - 18% in the case of rare classes and ~5% - 10% in the case of out-of-distribution data on several image classification tasks like CIFAR-10, MNIST, and ImageNet. SIMILAR is available as a part of the DISTIL toolkit: "https://github.com/decile-team/distil".

研究动机与目标

  • 解决现有主动学习方法在现实、非理想数据场景(如类别不平衡、冗余性和分布外 OOD 数据)下的局限性。
  • 开发一种单一、可扩展的框架,在无需大量重新配置的情况下,保持在多样化真实世界主动学习场景中的高性能。
  • 克服在罕见或 OOD 样本场景下,基于不确定性和多样性获取函数的不足,这些场景中当前方法难以泛化。
  • 通过基于子模信息度量(SIM)对分布内和 OOD 集进行条件化,实现稳健且稳定的主动学习性能。

提出的方法

  • 提出统一的主动学习框架 SIMILAR,使用子模信息度量(SIM)作为获取函数,以平衡信息量与多样性。
  • 引入两个关键变体:SMI(子模互信息)和 SCMI(子模条件互信息),其中 SCMI 显式地对分布内(ID)和 OOD 集进行条件化,以提升选择准确性。
  • 使用如 Logdetcmi 和 Flcmi 等 SCMI 函数,通过条件化先前选择的 ID 和 OOD 样本,同时整合不确定性和多样性。
  • 维护并动态更新两个集合:一个分布内(ID)集合和一个分布外(OOD)集合,用于随时间对获取函数进行条件化。
  • 利用深度神经网络表示计算相似性,实现可扩展的信息量与多样性样本选择的子模优化。
  • 将框架集成至 DISTIL 工具包中,实现开源可用性与真实世界部署。

实验结果

研究问题

  • RQ1单一主动学习框架能否同时有效应对多种现实数据挑战——罕见类别、冗余性和 OOD 数据?
  • RQ2与标准获取函数相比,对分布内和分布外集合进行条件化如何提升主动学习性能?
  • RQ3子模信息度量(SMI 和 SCMI)在准确率和方差方面,相较于基于不确定性和多样性的基线方法,其性能提升程度如何?
  • RQ4SCMI 变体(同时对 ID 和 OOD 集进行条件化)是否在多个主动学习轮次中表现出比 SMI 或基线方法更稳定可靠的性能?
  • RQ5SIMILAR 在大规模真实世界数据集(如 ImageNet)上是否仍能保持在罕见类别和 OOD 检测场景中的性能增益?

主要发现

  • 在 CIFAR-10 和 MNIST 上的罕见类别主动学习中,SIMILAR 相较于现有基线方法,准确率最高提升 18%。
  • 在分布外(OOD)数据场景中,SIMILAR 相较于最先进方法(如 Badge 和 Glister-Active)性能提升 5–10%。
  • 基于 SCMI 的获取函数(Logdetcmi 和 Flcmi)在后期主动学习轮次中持续优于 SMI 和基线方法,随着条件化强度增强,性能提升达 2–3%。
  • SCMI 函数在各次运行中的训练性能方差最低,表明其在真实世界部署中具有更高的鲁棒性和可靠性。
  • SIMILAR 选择的分布内(ID)样本比例高于其他方法,尤其在 OOD 样本占比较高的未标注集合中,显示出与目标任务更好的对齐性。
  • 即使在小规模验证集下,该框架仍保持强劲性能,优于依赖大规模标注验证集或预训练表示的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。