[论文解读] Meta-Query-Net: Resolving Purity-Informativeness Dilemma in Open-set Active Learning
该论文提出Meta-Query-Net(MQ-Net),一种元模型,通过利用多轮查询数据训练基于排序的元目标,自适应地平衡开放集主动学习中的纯度与信息量。在存在开放集噪声的ImageNet数据集上,MQ-Net相较于最先进方法实现了20.14%的准确率提升。
Unlabeled data examples awaiting annotations contain open-set noise inevitably. A few active learning studies have attempted to deal with this open-set noise for sample selection by filtering out the noisy examples. However, because focusing on the purity of examples in a query set leads to overlooking the informativeness of the examples, the best balancing of purity and informativeness remains an important question. In this paper, to solve this purity-informativeness dilemma in open-set active learning, we propose a novel Meta-Query-Net,(MQ-Net) that adaptively finds the best balancing between the two factors. Specifically, by leveraging the multi-round property of active learning, we train MQ-Net using a query set without an additional validation set. Furthermore, a clear dominance relationship between unlabeled examples is effectively captured by MQ-Net through a novel skyline regularization. Extensive experiments on multiple open-set active learning scenarios demonstrate that the proposed MQ-Net achieves 20.14% improvement in terms of accuracy, compared with the state-of-the-art methods.
研究动机与目标
- 解决开放集主动学习中选择信息丰富且纯度高的样本的挑战,其中未标注数据包含分布外(OOD)噪声。
- 克服纯度-信息量困境——优先考虑纯度可能导致遗漏信息丰富的样本,而优先考虑信息量则可能引入OOD样本。
- 开发一种元模型,根据学习阶段和噪声比例动态平衡纯度与信息量,且无需依赖外部验证集。
- 在现实场景中实现有效样本选择,其中数据整理不可避免地引入OOD样本,如网络爬取的图像。
- 通过在主动学习固有的多轮结构上训练元学习器,提升在真实开放集条件下的主动学习性能。
提出的方法
- 利用每轮主动学习的查询集训练MQ-Net,通过利用主动学习的多轮特性,消除了对独立验证集的需求。
- 将纯度定义为分布内概率(LL得分),将信息量定义为不确定性感知的表示多样性(CSI得分),并通过元目标将二者结合。
- 引入一种Skyline正则化,强制要求样本之间存在支配关系:若样本A在纯度和信息量上均明显优于样本B,则MQ-Net必须对A赋予更高的排名。
- 使用带Skyline约束的排序损失优化MQ-Net,以确保元得分能反映样本质量的合法、可传递的排序关系。
- 利用元目标学习纯度与信息量之间的动态平衡,后期更倾向于信息量。
- 端到端训练元模型,使其在存在OOD样本时仍能优先分配高优先级给分布内样本,同时保持对信息丰富样本的偏好。
实验结果
研究问题
- RQ1当分布内和分布外样本均表现出高不确定性与多样性时,如何有效解决开放集主动学习中的纯度-信息量困境?
- RQ2元模型是否能在无需独立验证集的情况下,自适应地在主动学习的不同阶段平衡纯度与信息量?
- RQ3基于Skyline的正则化是否能提升元得分排序在样本选择中的可靠性与一致性?
- RQ4MQ-Net在性能上是否优于对纯度与信息量采用启发式平衡规则(如线性组合或乘法)的方法?
- RQ5在现实部署场景中,当分布外样本的标注成本不同时,MQ-Net的鲁棒性如何?
主要发现
- 在存在开放集噪声的ImageNet数据集上,MQ-Net相较于最先进方法实现了20.14%的准确率提升。
- 在CIFAR-10数据集上,开放集噪声比例为40%时,MQ-Net在10轮主动学习后达到91.48%的测试准确率,优于所有基线方法,包括CCAL和SIMILAR。
- MQ-Net始终优于对纯度与信息量采用启发式规则(加法与乘法)的方法,尤其从第二轮起表现更优,验证了其元目标的有效性。
- MQ-Net在不同OOD标注成本(0.5至4)下均保持优异性能,最低成本下达到92.52%的测试准确率,展现出强鲁棒性。
- Skyline正则化使MQ-Net能够学习到有效且可传递的样本排序,确保明显更优的样本始终被优先选择。
- MQ-Net从早期以纯度为主转向后期更侧重信息量,根据学习阶段和噪声比例自适应调整,验证了其动态平衡能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。