[论文解读] Active Bias: Training More Accurate Neural Networks by Emphasizing High Variance Samples
本文提出两种轻量级的主动偏置重权策略,在 SGD 期间突出不确定样本,以提高神经网络在不同数据集和网络架构上的准确性与鲁棒性。
Self-paced learning and hard example mining re-weight training instances to improve learning accuracy. This paper presents two improved alternatives based on lightweight estimates of sample uncertainty in stochastic gradient descent (SGD): the variance in predicted probability of the correct class across iterations of mini-batch SGD, and the proximity of the correct class probability to the decision threshold. Extensive experimental results on six datasets show that our methods reliably improve accuracy in various network architectures, including additional gains on top of other popular training techniques, such as residual learning, momentum, ADAM, batch normalization, dropout, and distillation.
研究动机与目标
- 在不依赖标签噪声假设的前提下,通过平衡易样本和难样本来驱动鲁棒学习。
- 开发两种轻量级的基于不确定性的SGD偏置方法:基于预测方差的重加权和基于阈值接近度的重加权。
- 证明主动偏置在多数据集和多种架构上提升泛化能力。
- 展示与现有训练技术的兼容性以及在不同噪声条件下的有效性。
提出的方法
- 提出两种主动偏置方法在小批量 SGD 期间强调不确定样本:SGD-WPV(Weighted by Prediction Variance)和 SGD-WTC(Weighted by Threshold Closeness)。
- 从预测概率历史中估计预测方差以指导采样或加权;假设烧入期(burn-in)后参数后验不确定性。
- 使用阈值接近度目标,通过 p(y|x)^*(1-p(y|x)) 的乘积对样本加权,以瞄准边界样本。
- 在应用偏置之前提供一个烧入期以稳定不确定性估计。
- 将采样与损失加权变体(SGD-SPV、SGD-WPV、SGD-STC、SGD-WTC)与统一的 SGD、SGD-SD、SGD-ISD 基线进行比较。
- 证明与标准优化器和训练技巧(动量、Adam、批量归一化、 dropout、蒸馏)兼容。
实验结果
研究问题
- RQ1在 SGD 过程中强调不确定/高方差样本是否能提升跨任务和跨架构的泛化能力?
- RQ2基于方差和基于阈值的不确定性度量是否有效且对噪声和标签污染具有鲁棒性?
- RQ3主动偏置方法与常见训练技巧(例如动量、ADAM、批量归一化、蒸馏)如何交互?
- RQ4在应用主动偏置时,烧入期对可靠的不确定性估计是否必要?
- RQ5在易与难/带噪声的数据集上训练时,这些方法是否提供益处?
主要发现
- 主动偏置方法在六个数据集和多种架构上始终优于 SGD-Uni 和 SGD-Scan。
- SGD-WPV 和 SGD-WD 显示出稳健的改进,包括在嘈杂设置中(如 Noisy MNIST)。
- 基于阈值的加权(SGD-WTC/SGD-STC)在若干实验中取得有竞争力或更优的结果,包括 CIFAR 和 NLP 任务。
- 结合蒸馏时,主动偏置方法(尤其是 SGD-WTC)可以达到甚至超过单独蒸馏的效果,表明兼容性。
- 改进在从简单的逻辑回归基线到深度残差网络的广泛适用性持续存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。