Skip to main content
QUICK REVIEW

[论文解读] Choosing the Sample with Lowest Loss makes SGD Robust

Vatsal Shah, Xiaoxia Wu|arXiv (Cornell University)|Jan 10, 2020
Statistical Methods and Inference参考文献 35被引用 11
一句话总结

本文提出 Min-k Loss SGD(MKL-SGD),一种鲁棒的随机梯度下降变体,该方法在每次迭代中从随机选取的 k 个样本中选择损失最小的样本进行梯度更新。通过聚焦于低损失样本,MKL-SGD 在凸机器学习问题中展现出对异常值的改进鲁棒性,理论分析表明其可避免不良局部极小值,并在存在异常值的情况下收敛至优于标准 SGD 的解,尤其当 k 足够大时表现更优。

ABSTRACT

The presence of outliers can potentially significantly skew the parameters of machine learning models trained via stochastic gradient descent (SGD). In this paper we propose a simple variant of the simple SGD method: in each step, first choose a set of k samples, then from these choose the one with the smallest current loss, and do an SGD-like update with this chosen sample. Vanilla SGD corresponds to k = 1, i.e. no choice; k >= 2 represents a new algorithm that is however effectively minimizing a non-convex surrogate loss. Our main contribution is a theoretical analysis of the robustness properties of this idea for ML problems which are sums of convex losses; these are backed up with linear regression and small-scale neural network experiments

研究动机与目标

  • 为解决标准 SGD 在机器学习数据集中对异常值敏感的问题,此类异常值可能严重扭曲模型参数。
  • 开发一种简单、即插即用的 vanilla SGD 增强方法,提升鲁棒性,而无需对网络结构或算法进行重大修改。
  • 在各种设置下(包括无噪声和有噪声的数据,有无异常值)对所提方法的鲁棒性特性进行理论分析。
  • 在标签污染条件下,于线性回归和深度学习任务(MNIST、CIFAR-10)上对方法进行实证验证。
  • 证明从 k 个样本中选择损失最小样本可实现比标准 SGD 更优的收敛性与鲁棒性。

提出的方法

  • 在每次 SGD 迭代中,从训练数据中随机选取 k 个样本。
  • 从该集合中选择当前损失最小的样本用于梯度更新。
  • 更新规则遵循标准 SGD:w_{t+1} = w_t - η∇f_i(w_t),其中 i 为集合中损失最小样本的索引。
  • 该方法被分析为最小化一个非凸的代理损失函数,即使在无异常值的情况下亦成立。
  • 一种实用变体评估 k 个样本并选择大小为 αk 的批量,提升效率的同时保持鲁棒性。
  • 理论分析聚焦于强凸损失函数,并推导了在无噪声与有噪声设置下(有无异常值)的收敛速率。

实验结果

研究问题

  • RQ1从 k 个样本中选择损失最小样本是否能提升 SGD 在异常值下的鲁棒性?
  • RQ2在不同数据条件下,MKL-SGD 的收敛行为与局部极小值特性如何?
  • RQ3k 的选择如何影响在异常值存在下收敛速度与鲁棒性之间的权衡?
  • RQ4MKL-SGD 是否能在线性回归与深度学习设置下均优于标准 SGD 及其他鲁棒基线方法(如中位数损失 SGD)?
  • RQ5即使代理损失为非凸,MKL-SGD 是否仍能避免不良局部极小值?

主要发现

  • 当存在异常值时,MKL-SGD 比 vanilla SGD 更好地收敛至真实最优解,尤其当 k 足够大以降低高损失样本的影响时。
  • 在无噪声设置且存在异常值时,若 k 超过依赖于条件数的阈值,MKL-SGD 所达最近真实最优解 w* 的局部极小值优于 vanilla SGD 的不动点。
  • 在线性回归任务中,MKL-SGD 表现优于 SGD 和中位数损失 SGD,且在鲁棒性(更高 k)与收敛速度之间存在清晰权衡。
  • 在 MNIST 上使用两层 CNN 与标签噪声时,MKL-SGD 在 α=0.9 且 k=10 时达到 97.23% 准确率(在 ε=0.1 的定向噪声下),优于 SGD(96.76%),并接近最优模型性能(98.52%)。
  • 在 CIFAR-10 上使用 ResNet-18 与定向噪声时,MKL-SGD 在 α=0.7 且 k=16 时达到 81.00% 准确率(在 ε=0.1 时),优于 SGD(79.1%),并接近最优模型(84.56%)。
  • 理论分析证实,在无噪声情况下,即使 MKL-SGD 最小化的是非凸代理损失,仍可避免不良局部极小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。