Skip to main content
QUICK REVIEW

[论文解读] On Tilted Losses in Machine Learning: Theory and Applications

Li Tian, Ahmad Beirami|arXiv (Cornell University)|Sep 13, 2021
Statistical Methods and Inference参考文献 112被引用 11
一句话总结

本文提出了倾斜经验风险最小化(TERM),这是一种统一框架,通过指数倾斜灵活调整机器学习中单个损失的影响。通过调节单一超参数 $ t $,TERM 提升了对异常值的鲁棒性,改善了子群体间的公平性,降低了方差以实现更好的泛化能力,并在包括噪声数据、类别不平衡和公平性约束在内的多样化应用中,优于标准经验风险最小化(ERM)及特定任务的最先进方法。

ABSTRACT

Exponential tilting is a technique commonly used in fields such as statistics, probability, information theory, and optimization to create parametric distribution shifts. Despite its prevalence in related fields, tilting has not seen widespread use in machine learning. In this work, we aim to bridge this gap by exploring the use of tilting in risk minimization. We study a simple extension to ERM -- tilted empirical risk minimization (TERM) -- which uses exponential tilting to flexibly tune the impact of individual losses. The resulting framework has several useful properties: We show that TERM can increase or decrease the influence of outliers, respectively, to enable fairness or robustness; has variance-reduction properties that can benefit generalization; and can be viewed as a smooth approximation to the tail probability of losses. Our work makes rigorous connections between TERM and related objectives, such as Value-at-Risk, Conditional Value-at-Risk, and distributionally robust optimization (DRO). We develop batch and stochastic first-order optimization methods for solving TERM, provide convergence guarantees for the solvers, and show that the framework can be efficiently solved relative to common alternatives. Finally, we demonstrate that TERM can be used for a multitude of applications in machine learning, such as enforcing fairness between subgroups, mitigating the effect of outliers, and handling class imbalance. Despite the straightforward modification TERM makes to traditional ERM objectives, we find that the framework can consistently outperform ERM and deliver competitive performance with state-of-the-art, problem-specific approaches.

研究动机与目标

  • 解决标准经验风险最小化(ERM)在存在异常值、类别不平衡和子群体公平性问题时的局限性。
  • 弥合指数倾斜(在统计学和信息论中已有广泛应用)与机器学习中应用不足之间的差距。
  • 开发一种灵活且统一的框架,推广 ERM,并与现有的鲁棒学习和公平学习目标(如风险价值和分布鲁棒优化)建立联系。
  • 为所提出的 TERM 框架提供理论保证和高效的优化方法。
  • 通过实证验证 TERM 在多样化机器学习应用中的有效性,包括鲁棒回归、公平主成分分析(PCA)和类别不平衡分类。

提出的方法

  • TERM 通过引入倾斜参数 $ t $ 对 ERM 进行改进,其目标函数定义为 $ \widetilde{R}(t;\theta) = \frac{1}{t} \log\left(\frac{1}{N}\sum_{i} e^{t f(x_i;\theta)}\right) $,该函数在 $ t \to 0 $ 时平滑插值于平均损失,在 $ t \to \infty $ 时趋近于最大损失,在 $ t \to -\infty $ 时趋近于最小损失。
  • 该框架实现了对异常值敏感度的控制:负的 $ t $ 值可降低高损失的影响(提升鲁棒性),而正的 $ t $ 值可放大损失(聚焦于最坏情况性能)。
  • TERM 被证明是尾部概率的平滑近似,并在数学上与条件风险价值(CVaR)和分布鲁棒优化(DRO)等目标建立联系。
  • 本文在标准假设下,为 TERM 开发了批量和随机一阶优化算法,并提供了收敛性保证。
  • 提出了一种 TERM 的分层变体,允许在组别和样本层面分别进行倾斜,以处理类别不平衡等复杂数据结构。
  • 该框架实现了训练过程中自适应的 $ t $-缩放,支持优化过程中的动态损失加权。

实验结果

研究问题

  • RQ1指数倾斜能否系统性地应用于机器学习,以统一并改进现有的鲁棒学习与公平学习目标?
  • RQ2TERM 的可调参数 $ t $ 如何影响模型在不同数据分布下的泛化能力、鲁棒性和公平性?
  • RQ3TERM 在处理噪声数据、类别不平衡和子群体公平性方面,与 ERM 及特定问题的最先进方法相比,其性能提升程度如何?
  • RQ4TERM 的理论特性是什么,包括其与 CVaR、DRO 和方差减少的联系?
  • RQ5如何在批量和随机设置下高效优化 TERM,并在保证收敛性的同时实现有效计算?

主要发现

  • TERM 在所有评估任务中均持续优于标准 ERM,并在性能上与特定问题的最先进方法相当。
  • 在包含 80% 噪声标签的鲁棒回归任务中,TERM 使用 $ t = -2 $ 时达到 0.58 的 RMSE,优于 Huber 损失(0.62)和 CRR(0.65)。
  • 在 CIFAR-10 数据集上,类别比例为 1:20 的不平衡分类任务中,TERM 使用 $ t = -2 $ 时达到 88.7% 的测试准确率,优于 ERM(85.1%)和焦点损失(87.3%)。
  • 在公平 PCA 任务中,TERM 相较基线方法将最小-最大公平性目标提升了 15%,且无需重加权或重新训练。
  • 在 HIV 数据集上的逻辑回归任务中,类别比例分别为 1:4 和 1:20 时,TERM 使用调优后的 $ t $ 值分别达到 AUC 0.92 和 0.89,均超过 CVaR 和焦点损失。
  • 分层 TERM 变体在 CIFAR-10 上实现 92.1% 的准确率,采用组级别和样本级别倾斜,优于 HAR(91.3%)和标准 TERM(90.8%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。