[论文解读] Faster Meta Update Strategy for Noise-Robust Deep Learning
该论文提出了一种新型方法——更快元更新策略(FaMUS),通过可学习的分层采样机制近似元梯度,从而加速元学习,在保持或提升在噪声数据和长尾数据上泛化能力的同时,将训练时间减少多达三分之二。FaMUS在合成数据和真实世界噪声标签基准上实现了最先进性能,梯度方差更低,收敛更快。
It has been shown that deep neural networks are prone to overfitting on biased training data. Towards addressing this issue, meta-learning employs a meta model for correcting the training bias. Despite the promising performances, super slow training is currently the bottleneck in the meta learning approaches. In this paper, we introduce a novel Faster Meta Update Strategy (FaMUS) to replace the most expensive step in the meta gradient computation with a faster layer-wise approximation. We empirically find that FaMUS yields not only a reasonably accurate but also a low-variance approximation of the meta gradient. We conduct extensive experiments to verify the proposed method on two tasks. We show our method is able to save two-thirds of the training time while still maintaining the comparable or achieving even better generalization performance. In particular, our method achieves the state-of-the-art performance on both synthetic and realistic noisy labels, and obtains promising performance on long-tailed recognition on standard benchmarks.
研究动机与目标
- 为解决元学习当前因训练时间长3–7倍而限制其实际部署的高计算成本问题。
- 在存在噪声或偏差训练数据的情况下,提升训练效率而不牺牲泛化性能。
- 开发一种低方差、高精度的元梯度近似方法,以减少元训练步骤中的计算量。
- 在包含WebVision和CNWL在内的噪声标签基准上实现最先进性能,且额外计算开销极小。
提出的方法
- FaMUS用可学习的梯度采样器替代完整的元梯度计算,仅选择有信息量的层进行元梯度累积。
- 该方法引入一种可微的分层采样策略,学习在元梯度计算中包含哪些层,从而有效跳过对信息量较少的层的计算。
- 元梯度近似仅在采样层上计算,显著降低了元训练步骤中的反向传播成本。
- 可学习的采样器端到端训练,使模型能够自动识别并聚焦于对梯度更新最有信息量的层。
- 通过过滤掉不相关或冗余信号,该方法降低了梯度方差,从而实现更稳定的优化。
- FaMUS可应用于现有元学习框架(如MW-Net和L2R),仅需极少架构改动,且无需额外的干净数据。
实验结果
研究问题
- RQ1可学习的分层采样策略是否能以显著减少的计算量有效近似完整元梯度?
- RQ2与完整梯度计算相比,所提出的FaMUS方法是否能降低元梯度方差?
- RQ3FaMUS是否能在将训练时间减少三分之二的同时实现更快收敛和更好泛化?
- RQ4FaMUS在合成和真实世界噪声标签基准上是否能保持或提升性能?
- RQ5FaMUS是否能有效应用于长尾识别任务,在性能下降极小的同时实现显著加速?
主要发现
- 在WebVision数据集上,将FaMUS应用于MW-Net时,训练时间最多减少66%,且top-1准确率无损失。
- 在CIFAR-10和CIFAR-100对称标签噪声设置下,FaMUS在单尾t检验中相对于基线方法表现出统计显著提升(p < 0.05)。
- 在具有挑战性的CNWL基准上,FaMUS优于MentorMix和DivideMix等强基线方法,展现出在不同噪声率下的鲁棒性。
- 在Clothing1M数据集上,FaMUS实现74.4%的top-1准确率,且未使用额外干净数据,达到最先进性能。
- 在长尾识别任务中,FaMUS使MW-Net训练速度提升2.9倍,且始终优于先前的元学习方法,包括改进后的L2R。
- 如图1(c)所示,FaMUS的元梯度近似方差低于真实梯度,有助于实现更稳定高效的优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。