Skip to main content
QUICK REVIEW

[论文解读] Generalized Quantile Loss for Deep Neural Networks

Dvir Ben-Or, Michael Kolomenkin|arXiv (Cornell University)|Dec 28, 2020
Statistical Methods and Inference参考文献 6被引用 9
一句话总结

本文提出了一种新颖的优化框架,使深度神经网络能够在分位数约束下最小化任意可微损失函数——确保指定比例的预测值超过真实标签。通过结合基于梯度的优化与对可行集的迭代投影,该方法克服了计数约束的不可微性问题,并实现了收敛,如在摩托车数据集上的实验所示,该方法在不同分位数水平下均表现出更强的鲁棒性。

ABSTRACT

This note presents a simple way to add a count (or quantile) constraint to a regression neural net, such that given $n$ samples in the training set it guarantees that the prediction of $m

研究动机与目标

  • 解决在深度神经网络中施加分位数约束的挑战,因为标准梯度方法因不可微的计数函数而失效。
  • 将分位数回归推广至标准L1损失之外,允许使用任意可微损失函数,同时保持分位数约束。
  • 开发一种实用且收敛的优化方案,通过在局部最小值与满足计数约束的可行解之间交替进行。
  • 在具有不同分位数需求的真实回归任务中展示该方法的有效性。
  • 为交替优化过程的收敛性提供理论依据。

提出的方法

  • 该方法将问题表述为在计数约束下最小化一般损失函数:在n个预测中,恰好有m个预测值大于或等于真实标签。
  • 提出一种交替优化方案,包含两个算子:$\mathcal{P}_M$,用于寻找损失函数的最近局部最小值;$\mathcal{P}_C$,用于将权重投影到最近的满足计数约束的可行解上。
  • $\mathcal{P}_C$算子通过在平均预测值上进行梯度上升或下降来实现,具体取决于超出真实值的样本数量过多或过少。
  • 该算法迭代应用$\mathcal{P}_M$和$\mathcal{P}_C$,直至计数约束在容差$\delta$范围内满足。
  • 理论分析表明,连续$\mathcal{P}_M$与$\mathcal{P}_C$点之间的距离单调递减且有界,从而确保收敛至稳定解。
  • 该方法对非凸性具有鲁棒性,且不要求损失函数为L1或分位数特定形式,因此可与MSE、交叉熵或其他标准损失函数结合使用。

实验结果

研究问题

  • RQ1是否可以训练深度神经网络以最小化一般损失函数,同时强制执行预测值超过真实标签数量的硬约束?
  • RQ2如何将不可微的计数约束整合到基于梯度的深度学习优化中?
  • RQ3在实际训练条件下,所提出的交替投影方案是否收敛至稳定解?
  • RQ4与标准分位数回归相比,该方法在不同损失函数下的预测准确性和鲁棒性如何?
  • RQ5容差$\delta$对模型收敛性及最终性能有何影响?

主要发现

  • 该方法成功训练神经网络以最小化均方误差(MSE),同时施加分位数约束,实现了22.9的RMSE(无约束最小二乘基线性能最佳)。
  • 对于第25百分位数约束,模型实现了25.1的RMSE,表明该方法在严格分位数约束下仍能保持较低误差。
  • 第75百分位数约束下,RMSE为23.22,表明该方法在不同分位数水平下具有良好的泛化能力。
  • 第10百分位数约束导致RMSE升高至29.8,表明强制实现极低预测覆盖率会增加误差,符合预期。
  • 第90百分位数约束下,RMSE为31.6,进一步证实了覆盖率与准确性之间的权衡。
  • 理论分析确认,交替投影过程收敛,因为连续迭代点之间的距离单调递减且有界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。