Skip to main content
QUICK REVIEW

[论文解读] SGD with Hardness Weighted Sampling for Distributionally Robust Deep Learning

Lucas Fidon, Sébastien Ourselin|arXiv (Cornell University)|Sep 25, 2019
Risk and Portfolio Optimization参考文献 11被引用 6
一句话总结

本文提出了一种基于难度加权采样的随机梯度下降(HWS-SGD),这是一种高效且理论严谨的深度学习分布鲁棒优化(DRO)优化方法。通过基于softmax的加权方案自适应地重采样困难样本,并维护损失历史,HWS在过参数化的ReLU网络中实现了收敛,同时保持了SGD的计算效率,并优于临时性的困难样本挖掘策略。

ABSTRACT

Distributionally Robust Optimization (DRO) has been proposed as an alternative to Empirical Risk Minimization (ERM) in order to account for potential biases in the training data distribution. However, its use in deep learning has been severely restricted due to the relative inefficiency of the optimizers available for DRO in comparison to the wide-spread Stochastic Gradient Descent (SGD) based optimizers for deep learning with ERM. We propose SGD with Hardness weighted sampling, an efficient optimization method for machine learning with DRO with a focus on deep learning. In this work, we propose SGD with hardness weighted sampling, a principled and efficient optimization method for DRO in machine learning that is particularly suited in the context of deep learning. We show that our optimization method can be interpreted as a principled Hard Example Mining strategy. Similar to an online hard example mining strategy in essence and in practice, the proposed algorithm is straightforward to implement and computationally as efficient as SGD-based optimizers used for deep learning. It only requires adding a softmax layer and maintaining a history of the loss values for each training example to compute adaptive sampling probabilities. In contrast to typical ad hoc hard mining approaches, and exploiting recent theoretical results in deep learning optimization, we We also prove the convergence of our DRO algorithm for over-parameterized deep learning networks with ReLU activation and finite number of layers and parameters. Preliminary results demonstrate the feasibility and usefulness of our approach.

研究动机与目标

  • 解决现有DRO优化器在深度学习中效率低下的问题,尽管其对数据分布偏移具有鲁棒性,但效率限制了其实际应用。
  • 通过设计与标准SGD训练流水线兼容的方法,克服DRO的计算瓶颈。
  • 提出一种基于深度学习优化理论洞见的、有理论依据的困难样本挖掘替代方案,取代启发式方法。
  • 确保所提出的DRO算法在过参数化的ReLU激活深度网络中收敛,且网络深度有限。
  • 通过最小的架构和计算开销,实现DRO在真实世界深度学习应用中的实际部署。

提出的方法

  • 提出一种动态采样策略,根据每个样本的历史损失值赋予更高的采样概率,通过损失历史的softmax变换实现。
  • 维护每个训练样本的损失值历史记录,以计算自适应采样权重,使算法能随时间聚焦于困难样本。
  • 通过在每个训练步骤中修改采样分布,将采样机制集成到SGD中,保持标准SGD的简洁性和高效性。
  • 该方法在DRO理论框架内具有坚实的理论基础,可被解释为一种具有理论收敛保证的有原则的在线困难样本挖掘策略。
  • 在标准DRO假设下,证明了其在过参数化深度网络(ReLU激活函数,有限深度)中的收敛性。
  • 仅需增加一个额外的softmax层和损失历史追踪——对标准深度学习训练流水线的改动极小。

实验结果

研究问题

  • RQ1DRO能否在不牺牲鲁棒性的前提下,实现足够高的计算效率,以适用于深度学习的实际应用?
  • RQ2如何在DRO框架内将困难样本挖掘形式化为一种有理论依据的优化策略?
  • RQ3所提出的难度加权采样方法是否能在过参数化的ReLU激活深度网络中实现收敛?
  • RQ4该方法能否在保持与ERM-SGD相当性能的同时,提升对分布偏移的鲁棒性?
  • RQ5自适应采样对DRO训练中的泛化能力和收敛性有何影响?

主要发现

  • 所提出的HWS方法在计算效率上与标准SGD相当,可实现深度学习系统中的实际部署。
  • 该算法在理论层面被证明可在过参数化的ReLU激活深度网络(有限深度)中收敛。
  • HWS可被解释为一种有原则的在线困难样本挖掘策略,避免了典型启发式方法的随意性。
  • 该方法仅需极小的架构改动——仅增加一个softmax层和损失历史追踪,易于集成到现有训练流水线中。
  • 初步结果证实了该方法在提升鲁棒性方面具有可行性与有效性,且计算成本增加有限。
  • 该方法在保持SGD的简洁性与可扩展性的同时,实现了分布鲁棒性训练,弥合了DRO与标准深度学习优化之间的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。