Skip to main content
QUICK REVIEW

[论文解读] Geometric Losses for Distributional Learning

Arthur Mensch, Mathieu Blondel|arXiv (Cornell University)|May 15, 2019
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

本文通过将逻辑损失和Softmax推广为基于熵正则化最优传输与Fenchel对偶的几何损失,引入了用于分布学习的几何损失,实现了在连续或无限类别空间上的凸性、代价敏感学习。关键贡献是一种几何Softmax,能够对具有内在结构(如曲线或曲面)的分布进行建模,从而在序数回归和VAE生成建模中提升性能。

ABSTRACT

Building upon recent advances in entropy-regularized optimal transport, and upon Fenchel duality between measures and continuous functions , we propose a generalization of the logistic loss that incorporates a metric or cost between classes. Unlike previous attempts to use optimal transport distances for learning, our loss results in unconstrained convex objective functions, supports infinite (or very large) class spaces, and naturally defines a geometric generalization of the softmax operator. The geometric properties of this loss make it suitable for predicting sparse and singular distributions, for instance supported on curves or hyper-surfaces. We study the theoretical properties of our loss and show-case its effectiveness on two applications: ordinal regression and drawing generation.

研究动机与目标

  • 解决在具有结构化类别代价的 probabilistic 分类中,缺乏一种代价感知、凸性的 Softmax 广义形式的问题。
  • 克服现有基于最优传输的损失的局限性,这些损失非凸或仅限于有限类别。
  • 在保持凸性与几何保真度的前提下,实现对连续或无限输出空间的分布学习。
  • 开发一种理论坚实、Fisher一致的损失函数,支持稀疏与奇异分布(例如,支撑在曲线上)。
  • 在真实任务中验证其有效性,如序数回归与基于VAE的图像生成。

提出的方法

  • 基于熵正则化最优传输,利用测度与连续函数之间的Fenchel对偶性,形式化一种新型损失函数。
  • 通过Fenchel共轭定义几何Softmax,将标准Softmax推广以引入类别之间的代价矩阵。
  • 构建源自正则化最优传输的凸、弱-* 连续熵函数,确保在无限维空间中的理论严谨性。
  • 提出基于Frank-Wolfe的算法,用于在连续测度空间中进行优化。
  • 在离散设置中通过迭代求解对偶问题实现可计算的实现。
  • 将几何损失与Softmax集成到VAE中用于图像生成,使用像素级欧氏距离作为传输代价。

实验结果

研究问题

  • RQ1能否构建一种凸的、代价敏感的损失函数,其广义形式可推广逻辑损失并尊重几何类别关系?
  • RQ2如何以理论一致的方式将Softmax算子推广,以在类别之间引入度量结构?
  • RQ3此类损失是否能在不牺牲凸性的前提下,支持在连续或无限输出空间上的学习?
  • RQ4几何损失是否能提升涉及结构化或稀疏分布的任务(如序数回归或绘图生成)的性能?
  • RQ5在建模低维流形上的分布时,几何损失是否具有Fisher一致性且在实践中校准良好?

主要发现

  • 在序数回归中,几何损失的平均绝对误差(MAE)优于标准逻辑回归,尽管准确率略有下降,但其天然提供了完整的预测分布。
  • 在car数据集上,几何损失在训练过程中紧密跟踪Hausdorff散度,验证了其作为上界的作用,并确认了理论一致性。
  • 在基于VAE的绘图生成中,几何Softmax生成的重建结果更清晰,且集中在边缘区域,其在最小化非对称Hausdorff散度方面优于标准Softmax。
  • 与标准交叉熵相比,几何损失在生成建模中能更快收敛至Hausdorff散度的最小值。
  • 该方法在理论上保证了对无限或连续输出空间的支持,超越了离散分类的限制。
  • 由于最优传输求解器的引入,计算成本增加了约10倍,但在结构化任务中几何保真度与预测质量的提升显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。