[论文解读] Supervised Learning with General Risk Functionals
本文首次为监督学习中损失分布的累积分布函数(CDF)估计提供了统一收敛性保证,实现了对所有 Hölder 风险泛函和所有假设的同步泛化界。提出了一种新颖的基于梯度的优化方法,用于处理扭曲风险(subsuming mean, CVaR, and cumulative prospect theory risks),并附带理论收敛性保证,已在表格数据和深度学习设置中得到验证。
Standard uniform convergence results bound the generalization gap of the expected loss over a hypothesis class. The emergence of risk-sensitive learning requires generalization guarantees for functionals of the loss distribution beyond the expectation. While prior works specialize in uniform convergence of particular functionals, our work provides uniform convergence for a general class of Hölder risk functionals for which the closeness in the Cumulative Distribution Function (CDF) entails closeness in risk. We establish the first uniform convergence results for estimating the CDF of the loss distribution, yielding guarantees that hold simultaneously both over all Hölder risk functionals and over all hypotheses. Thus licensed to perform empirical risk minimization, we develop practical gradient-based methods for minimizing distortion risks (widely studied subset of Hölder risks that subsumes the spectral risks, including the mean, conditional value at risk, cumulative prospect theory risks, and others) and provide convergence guarantees. In experiments, we demonstrate the efficacy of our learning procedure, both in settings where uniform convergence results hold and in high-dimensional settings with deep networks.
研究动机与目标
- 解决超出期望损失之外的风险敏感学习缺乏泛化保证的问题。
- 建立假设类上 CDF 估计的统一收敛性,实现对所有 Hölder 风险泛函的同步边界。
- 开发一种实用的、基于梯度的扭曲风险优化方法——在风险敏感学习中广泛应用——并附带理论收敛性保证。
- 在低维和高维深度学习设置中对方法进行经验验证。
提出的方法
- 提出一种专为假设类中 CDF 估计量身定制的新复杂度度量——排列复杂度。
- 利用 Rademacher 复杂度和 VC 维,通过排列复杂度扩展,建立经验 CDF 到真实 CDF 的统一收敛性。
- 提出一个通用的 Hölder 风险泛函框架,其中 CDF 的接近性意味着风险的接近性,从而实现统一的泛化界。
- 开发一种经验扭曲风险最小化(EDRM)算法,根据 CDF 值对损失进行重加权,以支持基于梯度的优化。
- 在风险泛函的光滑性和利普希茨性假设下,推导 EDRM 算法的收敛性保证。
- 将方法应用于 CVaR、谱风险和累积前景理论等扭曲风险,并在深度网络中实现。
实验结果
研究问题
- RQ1能否在假设类上建立 CDF 估计的统一收敛性,从而确保对所有 Hölder 风险泛函的同步泛化?
- RQ2如何通过具有理论保证的基于梯度的方法高效优化如 CVaR 或谱风险等风险敏感目标?
- RQ3在监督学习中,实现 CDF 估计的统一收敛性,需要哪些必要且充分的新复杂度度量?
- RQ4所提出的泛化与优化方法在高维深度学习设置中在多大程度上成立?
- RQ5在分布偏移、噪声标签和类别不平衡方面,所提出的方法与标准 ERM 相比表现如何?
主要发现
- 本文首次建立了 CDF 估计的统一收敛性结果,其界由 Rademacher 复杂度、VC 维以及一种新颖的排列复杂度度量导出。
- 所有 Hölder 风险泛函和模型类中所有假设的泛化保证可同时成立,实现无风险泛化。
- 所提出的 EDRM 算法在标准光滑性和利普希茨条件下收敛至驻点,收敛速率为 O(1/√T)。
- 实验结果表明,该方法在类别不平衡和标签噪声设置下提升了鲁棒性,尤其在 CVaR 和谱风险目标下表现更优。
- 在 ImageNet 实验中,通过该方法优化的模型在不同 α 水平下表现出更优的最坏情况性能(如更低的 CVaR),表明其在尾部分布风险控制方面更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。