Skip to main content
QUICK REVIEW

[论文解读] Improving Regression Performance with Distributional Losses

Ehsan Imani, Martha White|arXiv (Cornell University)|Jun 12, 2018
Machine Learning and Data Classification参考文献 23被引用 11
一句话总结

本文提出直方图损失(HL),一种新颖的分布回归损失,通过将目标建模为概率分布并最小化预测分布与目标分布之间的KL散度(使用直方图密度),从而提升预测精度。其核心贡献在于:性能提升主要源于更优的梯度优化——带来更快的收敛速度和更平稳的训练过程——而非过拟合减少或表征能力增强。

ABSTRACT

There is growing evidence that converting targets to soft targets in supervised learning can provide considerable gains in performance. Much of this work has considered classification, converting hard zero-one values to soft labels---such as by adding label noise, incorporating label ambiguity or using distillation. In parallel, there is some evidence from a regression setting in reinforcement learning that learning distributions can improve performance. In this work, we investigate the reasons for this improvement, in a regression setting. We introduce a novel distributional regression loss, and similarly find it significantly improves prediction accuracy. We investigate several common hypotheses, around reducing overfitting and improved representations. We instead find evidence for an alternative hypothesis: this loss is easier to optimize, with better behaved gradients, resulting in improved generalization. We provide theoretical support for this alternative hypothesis, by characterizing the norm of the gradients of this loss.

研究动机与目标

  • 探究为何软目标和分布输出能超越减少过拟合的范畴,提升回归性能。
  • 提出一种新型高效分布损失用于回归,保持建模灵活性的同时实现快速计算。
  • 识别分布回归中性能提升的主要驱动因素——优化特性而非表征或正则化。
  • 为假设‘更优的梯度行为可带来更好的泛化性能’提供理论与实证支持。

提出的方法

  • 直方图损失(HL)将硬回归目标转换为目标分布(如基于区间的高斯分布或均匀分布),并最小化该目标分布与预测直方图密度之间的KL散度。
  • 预测分布以固定区间、宽度和中心的直方图表示,从而在不损失建模能力的前提下实现KL散度的高效计算。
  • 最终预测为预测直方图分布的期望值,确保与标准回归评估方法兼容。
  • 该方法在多个数据集上应用,并与标准ℓ₂损失、标签平滑及裁剪/噪声变体进行比较,以隔离损失函数的影响。
  • 通过计算并归一化训练各周期的梯度范数,评估优化稳定性与收敛速度。
  • 消融研究对比HL与ℓ₂ + softmax以及ℓ₂加噪声/裁剪的设置,隔离分布损失本身对性能的影响,排除非线性或正则化的影响。

实验结果

研究问题

  • RQ1通过分布损失将回归目标建模为分布,是否能在泛化性能上超越标准ℓ₂损失?
  • RQ2性能提升是源于过拟合减少、表征能力增强,还是优化动力学改善?
  • RQ3在训练过程中,直方图损失的梯度范数与标准回归损失相比如何?
  • RQ4基于KL散度的分布损失是否能实现更快收敛与更稳定的训练?
  • RQ5目标分布的选择(如高斯分布与均匀分布)如何影响性能与优化过程?

主要发现

  • 直方图损失(HL)显著提升回归精度,在CT位置数据集上将测试MAE从ℓ₂基线的18.421降低至8.992。
  • HL-Gaussian的收敛速度更快且梯度更平稳,归一化梯度范数图显示其波动更小、衰减更快。
  • HL的性能提升并非源于过拟合减少或表征能力增强,消融研究对比ℓ₂加噪声或裁剪设置已证实此点。
  • HL-Gaussian的梯度范数保持有界且稳定,支持‘更优优化梯度驱动泛化性能提升’的假设。
  • 即使与ℓ₂ + softmax(增加100个参数并引入非线性)相比,HL-Gaussian仍大幅领先,表明损失结构本身是关键因素。
  • 理论分析表明,HL梯度的范数不会显著增大或剧烈波动,支持其优越的优化特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。