[论文解读] Consistency-based Semi-supervised Active Learning: Towards Minimizing Labeling Cost
本文提出了一种基于一致性的半监督主动学习框架,通过一致性正则化利用未标记数据,将模型训练与样本选择统一起来,实现了极低标注成本下的最先进性能。该方法利用数据增强下的预测一致性来识别不确定且信息量大的样本进行标注,在CIFAR-10、CIFAR-100和ImageNet上显著优于先前的主动学习与半监督学习结合方法。
Active learning (AL) combines data labeling and model training to minimize the labeling cost by prioritizing the selection of high value data that can best improve model performance. In pool-based active learning, accessible unlabeled data are not used for model training in most conventional methods. Here, we propose to unify unlabeled sample selection and model training towards minimizing labeling cost, and make two contributions towards that end. First, we exploit both labeled and unlabeled data using semi-supervised learning (SSL) to distill information from unlabeled data during the training stage. Second, we propose a consistency-based sample selection metric that is coherent with the training objective such that the selected samples are effective at improving model performance. We conduct extensive experiments on image classification tasks. The experimental results on CIFAR-10, CIFAR-100 and ImageNet demonstrate the superior performance of our proposed method with limited labeled data, compared to the existing methods and the alternative AL and SSL combinations. Additionally, we study an important yet under-explored problem -- "When can we start learning-based AL selection?". We propose a measure that is empirically correlated with the AL target loss and is potentially useful for determining the proper starting point of learning-based AL methods.
研究动机与目标
- 通过在训练过程中整合未标记数据以实现半监督学习,来最小化主动学习中的标注成本。
- 通过提出一种基于数据的准则来确定最优初始标注数据集大小,以解决基于学习的主动学习中的冷启动问题。
- 通过使选择度量与半监督学习(SSL)训练目标对齐,统一样本选择与模型训练。
- 开发一种基于一致性的度量方法,以隐式平衡样本选择中的不确定性和多样性。
提出的方法
- 采用一种半监督学习框架,训练过程中同时使用已标注和未标注数据,通过基于一致性的损失函数鼓励对同一数据的不同增强版本产生一致的预测。
- 提出一种基于一致性的选择度量方法,通过测量同一数据样本的原始版本与增强版本之间的预测不一致程度来评估未标注样本。
- 选择一致性得分较低的样本(表示高不确定性或模糊性)进行人工标注,因为这些样本最有可能显著提升模型性能。
- 在每个训练周期中联合优化交叉熵损失(用于已标注数据)和一致性损失(用于未标注数据)。
- 引入一种基于预测标签分布与真实标签分布之间交叉熵的新度量方法,用于估计目标主动学习损失并指导初始规模的选择。
- 以MixMatch作为基础的半监督学习模型,并在多个数据集上评估该方法,包括CIFAR-10、CIFAR-100和ImageNet。
实验结果
研究问题
- RQ1通过在主动学习中整合未标记数据以实现半监督训练,是否能够以更低的标注成本提升模型性能?
- RQ2如何设计一种基于一致性的度量方法,使其与SSL训练目标对齐,并有效选择信息量大的样本?
- RQ3是否存在一种可靠且标签高效的策略,用于确定基于学习的主动学习的最优初始规模,以缓解冷启动问题?
- RQ4与标准的主动学习与半监督学习结合方法相比,所提出方法在性能和标注效率方面表现如何?
主要发现
- 所提出的半监督主动学习方法在CIFAR-10、CIFAR-100和ImageNet上实现了最先进性能,且所需标注样本数量显著少于现有主动学习与半监督学习基线方法。
- 在CIFAR-10上,该方法在总共3000个标注样本后达到82.75%的准确率,优于基于熵的选择方法(82.67%)和k-center方法(81.70%)在相同设置下的表现。
- 基于一致性的选择度量方法通过定性和定量分析验证了其能隐式平衡不确定性和多样性。
- 基于H[p(Y), p(Ŷ)]的所提度量方法与真实主动学习目标损失之间表现出强烈的实证相关性,从而能够在无需额外标注的情况下有效估计最优初始规模。
- 在CIFAR-10上,初始标注集大小为100–150个样本时达到最优,因为此时H[p(Y), p(Ŷ)]值趋于稳定,表明进一步扩大规模的收益递减。
- 该方法在低数据场景下表现出鲁棒性,并通过实现更早、更明智的样本选择,有效缓解了冷启动问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。