Skip to main content
QUICK REVIEW

[论文解读] Meta-Query-Net: Resolving Purity-Informativeness Dilemma in Open-set Active Learning

Dongmin Park, Yooju Shin|arXiv (Cornell University)|Oct 13, 2022
Machine Learning and Algorithms被引用 6
一句话总结

该论文提出Meta-Query-Net(MQ-Net),一种元模型,通过利用多轮查询数据训练基于排序的元目标,自适应地平衡开放集主动学习中的纯度与信息量。在存在开放集噪声的ImageNet数据集上,MQ-Net相较于最先进方法实现了20.14%的准确率提升。

ABSTRACT

Unlabeled data examples awaiting annotations contain open-set noise inevitably. A few active learning studies have attempted to deal with this open-set noise for sample selection by filtering out the noisy examples. However, because focusing on the purity of examples in a query set leads to overlooking the informativeness of the examples, the best balancing of purity and informativeness remains an important question. In this paper, to solve this purity-informativeness dilemma in open-set active learning, we propose a novel Meta-Query-Net,(MQ-Net) that adaptively finds the best balancing between the two factors. Specifically, by leveraging the multi-round property of active learning, we train MQ-Net using a query set without an additional validation set. Furthermore, a clear dominance relationship between unlabeled examples is effectively captured by MQ-Net through a novel skyline regularization. Extensive experiments on multiple open-set active learning scenarios demonstrate that the proposed MQ-Net achieves 20.14% improvement in terms of accuracy, compared with the state-of-the-art methods.

研究动机与目标

  • 解决开放集主动学习中选择信息丰富且纯度高的样本的挑战,其中未标注数据包含分布外(OOD)噪声。
  • 克服纯度-信息量困境——优先考虑纯度可能导致遗漏信息丰富的样本,而优先考虑信息量则可能引入OOD样本。
  • 开发一种元模型,根据学习阶段和噪声比例动态平衡纯度与信息量,且无需依赖外部验证集。
  • 在现实场景中实现有效样本选择,其中数据整理不可避免地引入OOD样本,如网络爬取的图像。
  • 通过在主动学习固有的多轮结构上训练元学习器,提升在真实开放集条件下的主动学习性能。

提出的方法

  • 利用每轮主动学习的查询集训练MQ-Net,通过利用主动学习的多轮特性,消除了对独立验证集的需求。
  • 将纯度定义为分布内概率(LL得分),将信息量定义为不确定性感知的表示多样性(CSI得分),并通过元目标将二者结合。
  • 引入一种Skyline正则化,强制要求样本之间存在支配关系:若样本A在纯度和信息量上均明显优于样本B,则MQ-Net必须对A赋予更高的排名。
  • 使用带Skyline约束的排序损失优化MQ-Net,以确保元得分能反映样本质量的合法、可传递的排序关系。
  • 利用元目标学习纯度与信息量之间的动态平衡,后期更倾向于信息量。
  • 端到端训练元模型,使其在存在OOD样本时仍能优先分配高优先级给分布内样本,同时保持对信息丰富样本的偏好。

实验结果

研究问题

  • RQ1当分布内和分布外样本均表现出高不确定性与多样性时,如何有效解决开放集主动学习中的纯度-信息量困境?
  • RQ2元模型是否能在无需独立验证集的情况下,自适应地在主动学习的不同阶段平衡纯度与信息量?
  • RQ3基于Skyline的正则化是否能提升元得分排序在样本选择中的可靠性与一致性?
  • RQ4MQ-Net在性能上是否优于对纯度与信息量采用启发式平衡规则(如线性组合或乘法)的方法?
  • RQ5在现实部署场景中,当分布外样本的标注成本不同时,MQ-Net的鲁棒性如何?

主要发现

  • 在存在开放集噪声的ImageNet数据集上,MQ-Net相较于最先进方法实现了20.14%的准确率提升。
  • 在CIFAR-10数据集上,开放集噪声比例为40%时,MQ-Net在10轮主动学习后达到91.48%的测试准确率,优于所有基线方法,包括CCAL和SIMILAR。
  • MQ-Net始终优于对纯度与信息量采用启发式规则(加法与乘法)的方法,尤其从第二轮起表现更优,验证了其元目标的有效性。
  • MQ-Net在不同OOD标注成本(0.5至4)下均保持优异性能,最低成本下达到92.52%的测试准确率,展现出强鲁棒性。
  • Skyline正则化使MQ-Net能够学习到有效且可传递的样本排序,确保明显更优的样本始终被优先选择。
  • MQ-Net从早期以纯度为主转向后期更侧重信息量,根据学习阶段和噪声比例自适应调整,验证了其动态平衡能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。