Skip to main content
QUICK REVIEW

[论文解读] Learning with Fenchel-Young Losses

Mathieu Blondel, André F. T. Martins|arXiv (Cornell University)|Jan 8, 2019
Statistical Mechanics and Entropy参考文献 97被引用 7
一句话总结

本文提出了Fenchel-Young损失,一种基于凸对偶性的统一框架,用于通过凸对偶性系统化构建凸损失函数,从而实现对分类、回归和结构化预测等各类监督学习任务的损失函数的系统性设计。该框架恢复了诸如合页损失、逻辑损失和稀疏max等经典损失函数,同时能够生成具有理想性质(如稀疏性与最大间隔)的新颖、高效的损失函数。

ABSTRACT

Over the past decades, numerous loss functions have been been proposed for a variety of supervised learning tasks, including regression, classification, ranking, and more generally structured prediction. Understanding the core principles and theoretical properties underpinning these losses is key to choose the right loss for the right problem, as well as to create new losses which combine their strengths. In this paper, we introduce Fenchel-Young losses, a generic way to construct a convex loss function for a regularized prediction function. We provide an in-depth study of their properties in a very broad setting, covering all the aforementioned supervised learning tasks, and revealing new connections between sparsity, generalized entropies, and separation margins. We show that Fenchel-Young losses unify many well-known loss functions and allow to create useful new ones easily. Finally, we derive efficient predictive and training algorithms, making Fenchel-Young losses appealing both in theory and practice.

研究动机与目标

  • 将各类现有损失函数(如合页损失、逻辑损失和稀疏max)统一到一个理论框架之下。
  • 通过利用正则化预测函数与凸对偶性,提供一种系统性、几何化的损失函数设计方法。
  • 建立结构化输出空间中稀疏性、广义熵与分离边界之间的理论联系。
  • 通过基于对偶的优化方法,实现高效训练与预测算法。
  • 将该框架扩展至概率分类之外的结构化领域,如凸多面体、锥体和正测度空间。

提出的方法

  • 该框架通过预测函数与其共轭之间的Fenchel-Young不等式间隙构建损失函数,利用凸对偶性确保损失的凸性。
  • 通过Fenchel-Young构造定义损失:$\ell(\bm{\theta}; y) = \Omega^*(\bm{y}) - \bm{y}^\top \bm{\theta} + \Omega(\bm{\theta})$,其中$\Omega$为正则化项,$\bm{y}$为预测值。
  • 通过选择适当的凸共轭,该方法可推广至任意正则化预测函数,包括softmax、sparsemax和边缘推理等。
  • 推导出高效的原始与对偶优化算法,包括用于求解对偶问题的牛顿型方法。
  • 通过将$\bm{y}$定义为凸集(如单纯形、多面体)中的点,支持结构化输出,从而实现损失的几何化设计。
  • 提出“Fenchel-Young化”——一种从任意正则化预测函数系统生成新损失函数的程序。

实验结果

研究问题

  • RQ1能否开发一个单一、统一的框架,系统化地构建适用于各类监督学习任务(包括结构化预测与非概率模型)的凸损失函数?
  • RQ2Fenchel-Young损失与经典损失(如合页损失、逻辑损失和sparsemax)之间有何关系?其统一的理论原理是什么?
  • RQ3Fenchel-Young损失在几何与统计特性方面表现如何,特别是关于稀疏性、最大间隔与结构化输出空间中的分离性?
  • RQ4该框架能否生成新的、有用的损失函数(如排序损失或正测度损失),使其在保持凸性的同时优化效率高?
  • RQ5从Fenchel-Young构造导出的原始与对偶优化过程在理论与算法特性上具有哪些特征?

主要发现

  • Fenchel-Young框架恢复了12种知名损失函数,包括合页损失、逻辑损失、sparsemax和CRF损失,展示了其广泛的统一能力。
  • 该框架证明了SparseMAP损失可实现单位分离边界,为该损失的鲁棒性提供了理论依据。
  • 针对平滑合页损失,论文推导出Fenchel-Young对偶的闭式表达式,从而实现了高效的优化。
  • 该框架支持设计新型损失函数,如排序损失和正测度损失,突破了传统概率设定的限制。
  • 原始与对偶训练算法被证明具有高效性,其中对偶方法在实践中收敛更快,尤其在高维结构化输出场景下表现更优。
  • 理论分析证实,Fenchel-Young损失具有Fisher一致性,并支持广义分离边界,从而与泛化界建立理论联系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。