[论文解读] Learning with Non-Convex Truncated Losses by SGD
本文提出了一种非凸截断损失框架,用于在重尾噪声和异常值存在下的鲁棒学习,通过随机梯度下降(SGD)最小化经验风险。该研究建立了近似平稳点的过剩风险边界和统计误差保证,证明了在浅层和深层学习设置下,该方法在无需事先了解噪声分布的情况下,表现出更优的鲁棒性。
Learning with a {\it convex loss} function has been a dominating paradigm for many years. It remains an interesting question how non-convex loss functions help improve the generalization of learning with broad applicability. In this paper, we study a family of objective functions formed by truncating traditional loss functions, which is applicable to both shallow learning and deep learning. Truncating loss functions has potential to be less vulnerable and more robust to large noise in observations that could be adversarial. More importantly, it is a generic technique without assuming the knowledge of noise distribution. To justify non-convex learning with truncated losses, we establish excess risk bounds of empirical risk minimization based on truncated losses for heavy-tailed output, and statistical error of an approximate stationary point found by stochastic gradient descent (SGD) method. Our experiments for shallow and deep learning for regression with outliers, corrupted data and heavy-tailed noise further justify the proposed method.
研究动机与目标
- 解决在机器学习中存在重尾噪声和异常值时,凸损失函数的局限性。
- 开发一种通用的、与分布无关的鲁棒学习方法,无需事先了解噪声特征。
- 从理论上证明在浅层和深层学习中,非凸截断损失在经验风险最小化(ERM)中的适用性。
- 分析SGD在截断损失框架下寻找近似平稳点的统计性能。
- 在数据被污染和重尾噪声的回归任务上,对所提方法进行实证验证。
提出的方法
- 本文引入了一类非凸截断损失函数,定义为 φ(ℓ(h(xi), yi)),其中 ℓ 为标准损失,φ 通过截断大值来降低对异常值的敏感性。
- 基于截断损失函数构建经验风险最小化(ERM)问题,以最小化训练数据上截断损失的平均值。
- 理论分析建立了在重尾输出分布下,使用截断损失的ERM的过剩风险边界。
- 推导了在截断损失框架下,SGD找到的近似平稳点的统计误差边界。
- 该方法被应用于浅层和深层学习模型,且对噪声分布仅假设其具有次指数或重尾行为,无需额外假设。
- 该方法具有通用性,无需事先了解噪声分布,因此可广泛适用于具有异常值的真实世界数据。
实验结果
研究问题
- RQ1非凸截断损失函数是否能在重尾噪声和异常值存在下提升泛化性能?
- RQ2在使用截断损失与SGD时,过剩风险和统计误差的理论保证是什么?
- RQ3在数据被污染和重尾分布下,基于截断损失的学习方法与标准凸损失方法相比表现如何?
- RQ4所提方法是否在无需噪声分布假设的前提下,对浅层和深层学习模型均表现出鲁棒性和有效性?
- RQ5SGD是否能在非凸截断损失函数下可靠收敛至良好解,其收敛特性如何?
主要发现
- 本文在重尾输出分布下,建立了使用截断损失的ERM的过剩风险边界,表明对异常值具有更强的鲁棒性。
- 推导了SGD找到的近似平稳点的统计误差边界,证明了其理论收敛至近似最优解。
- 在含被污染数据和重尾噪声的回归任务中,所提方法性能优于标准凸损失函数。
- 在浅层和深层学习模型上的实验结果证实,截断损失在存在对抗性或被污染观测时仍具有鲁棒性。
- 该方法无需事先了解噪声分布,因此是适用于未知或重尾噪声的真实世界数据的通用且实用的解决方案。
- 理论与实证结果共同验证了非凸截断损失作为标准凸损失的鲁棒替代方案在学习中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。