[论文解读] Searching to Exploit Memorization Effect in Learning from Corrupted Labels
本文提出S2E,一种基于AutoML的新方法,可自动学习最优样本选择调度策略,以利用深度网络在噪声标签训练中的记忆效应。通过将选择过程建模为特定领域搜索空间上的双层优化问题,并采用随机松弛牛顿算法,S2E在基准数据集上实现了最先进性能,准确率与效率均优于现有方法,在干净样本选择与泛化能力方面表现更优。
Sample selection approaches are popular in robust learning from noisy labels. However, how to properly control the selection process so that deep networks can benefit from the memorization effect is a hard problem. In this paper, motivated by the success of automated machine learning (AutoML), we model this issue as a function approximation problem. Specifically, we design a domain-specific search space based on general patterns of the memorization effect and propose a novel Newton algorithm to solve the bi-level optimization problem efficiently. We further provide theoretical analysis of the algorithm, which ensures a good approximation to critical points. Experiments are performed on benchmark data sets. Results demonstrate that the proposed method is much better than the state-of-the-art noisy-label-learning approaches, and also much more efficient than existing AutoML algorithms.
研究动机与目标
- 解决在存在噪声标签的深度学习中选择最优训练样本的挑战,其中人工设计的调度策略次优且不可行。
- 通过在训练过程中动态调整样本选择,利用网络先学习干净模式后才过拟合噪声标签的记忆效应。
- 开发一种自动化的、数据依赖的方法,以替代现有样本选择方法(如Co-teaching)中手动设计的调度策略。
- 基于深度网络中观察到的学习曲线模式,设计一个紧凑但表达力强的调度策略搜索空间。
- 提出一种高效的搜索算法,通过随机松弛与牛顿法克服离散样本选择的不可微性问题。
提出的方法
- 将样本选择调度学习建模为双层优化问题,类比神经架构搜索,其中外层优化调度策略,内层训练学生网络。
- 基于基函数设计特定领域的搜索空间,反映典型记忆行为:训练初期损失较高,随后迅速收敛至低损失。
- 引入随机松弛技术以近似离散样本选择算子,使梯度计算成为可能,从而支持优化。
- 采用牛顿法结合Hessian近似,高效优化外层目标,同时整合模型性能与优化动力学。
- 使用S型输出层参数化选择比例函数 $ R(t) $,确保在每个训练轮次 $ t $ 对所选样本比例实现平滑且可微的控制。
- 将学习到的调度策略集成到类似Co-teaching的框架中,使两个网络基于彼此预测的选定干净样本进行训练。
实验结果
研究问题
- RQ1自动化、数据驱动的方法是否能在噪声标签学习的样本选择中超越人工设计的调度策略?
- RQ2如何通过自适应、动态的样本选择有效利用深度网络中的记忆效应?
- RQ3一个表达力强但紧凑的调度策略搜索空间应如何设计,以在不同数据集与网络架构间实现泛化?
- RQ4能否有效将基于梯度的搜索算法应用于离散且不可微的样本选择过程?
- RQ5所提方法是否在噪声标签学习中相比最先进方法展现出更好的泛化能力与效率?
主要发现
- S2E在CIFAR-10(对称噪声50%时准确率50.82%)、CIFAR-100(对称噪声50%时准确率38.74%)和MNIST(成对噪声45%时准确率96.90%)上均达到最先进测试准确率,优于现有方法。
- 与基线方法相比,S2E选择的干净样本比例显著更高,所有数据集与噪声类型下标签精确率均保持一致更高。
- 在CIFAR-10上,采用牛顿法搜索的S2E收敛速度优于梯度下降、自然梯度、贝叶斯优化与Hyperband,所需模型训练调用次数更少。
- 消融实验表明,所提出的搜索空间优于通用函数逼近器(RBF、MLP),甚至优于Co-teaching与单基函数设计。
- MLP基线学习到的 $ R(t) $ 函数与假设1所预期的形状高度吻合,验证了搜索空间设计的有效性。
- 随机松弛与牛顿法的结合使非可微样本选择过程实现高效优化,并具备理论收敛至临界点的保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。