Skip to main content
QUICK REVIEW

[论文解读] Learning Adaptive Loss for Robust Learning with Noisy Labels

Jun Shu, Qian Zhao|arXiv (Cornell University)|Feb 16, 2020
Machine Learning and Data Classification参考文献 56被引用 15
一句话总结

本文提出一种自适应鲁棒学习(ARL)框架,通过元学习联合优化网络权重与鲁棒损失函数的超参数,实现自动、数据驱动的超参数调优。该方法在多种鲁棒损失函数和数据集上持续优于传统的超参数调优方法及最先进基线模型,展现出在标签噪声下的优越泛化能力。

ABSTRACT

Robust loss minimization is an important strategy for handling robust learning issue on noisy labels. Current robust loss functions, however, inevitably involve hyperparameter(s) to be tuned, manually or heuristically through cross validation, which makes them fairly hard to be generally applied in practice. Besides, the non-convexity brought by the loss as well as the complicated network architecture makes it easily trapped into an unexpected solution with poor generalization capability. To address above issues, we propose a meta-learning method capable of adaptively learning hyperparameter in robust loss functions. Specifically, through mutual amelioration between robust loss hyperparameter and network parameters in our method, both of them can be simultaneously finely learned and coordinated to attain solutions with good generalization capability. Four kinds of SOTA robust loss functions are attempted to be integrated into our algorithm, and comprehensive experiments substantiate the general availability and effectiveness of the proposed method in both its accuracy and generalization performance, as compared with conventional hyperparameter tuning strategy, even with carefully tuned hyperparameters.

研究动机与目标

  • 为解决鲁棒损失函数中超参数手动调优带来的挑战,该挑战限制了实际部署与泛化能力。
  • 通过实现端到端、自适应的鲁棒损失超参数学习,减少对交叉验证和启发式调优的依赖。
  • 通过联合优化网络参数与鲁棒损失超参数,提升深度学习在标签噪声下的泛化能力。
  • 在多种最先进鲁棒损失函数上验证所提方法的通用性与有效性。
  • 提供一个理论基础扎实的迭代式元学习框架,在高度非凸优化设置中提升解的质量。

提出的方法

  • 提出一种元学习框架,采用双层优化方案,交替更新网络参数与鲁棒损失超参数。
  • 引入一种相互增强机制,使超参数与网络权重协同优化,以提升泛化性能。
  • 将该框架应用于四种最先进鲁棒损失函数:GCE、SL、Bi-Tempered 和 PolySoft,证明其广泛适用性。
  • 采用两阶段训练流程:内层循环针对给定超参数优化网络权重,外层循环使用元验证损失更新超参数。
  • 对网络与超参数优化均采用自适应学习率的SGD,结合学习率衰减与权重衰减以增强稳定性。
  • 该方法通过在训练过程中动态调整损失函数的鲁棒性,有效减少对噪声标签的过拟合。

实验结果

研究问题

  • RQ1元学习方法能否在无需手动交叉验证的情况下,有效且自动地调优鲁棒损失函数中的超参数?
  • RQ2联合优化网络权重与鲁棒损失超参数是否能比固定超参数设置带来更好的泛化性能?
  • RQ3在不同噪声率下,所提出的自适应学习策略与传统超参数调优相比,在准确率与鲁棒性方面表现如何?
  • RQ4该框架能否泛化至不同类型的最先进鲁棒损失函数,包括具有理论鲁棒性保障的损失函数?
  • RQ5超参数与网络参数之间的迭代相互增强是否能获得比顺序优化更好的解?

主要发现

  • ARL方法在所有测试的鲁棒损失函数(包括GCE、SL、Bi-Tempered 和 PolySoft)中均持续优于传统的交叉验证超参数调优方法。
  • 在CIFAR-10数据集上,ARL在不同噪声率下均取得更高测试准确率,尤其在40%噪声率下,相较于标准SL方法,准确率最高提升5.2%。
  • 在真实世界数据集Clothing1M上,A-PolySoft达到87.6%的Top-1准确率,超越所有基线模型,展现出在大规模噪声数据上的强大泛化能力。
  • 消融实验表明,超参数与网络权重之间的相互增强机制至关重要,因为ARL在固定其一而优化另一方的策略下表现更优。
  • t-SNE可视化显示,基于ARL的模型(如A-Bi-Tempered)学习到的表征更具可分性且聚类更紧密,优于CE或标准Bi-Tempered模型。
  • 即使在超参数未被最优初始化的情况下,该方法仍表现出色,表明其对初始化与噪声具有强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。