[论文解读] Wasserstein Distributionally Robust Optimization and Variation Regularization
本文建立了Wasserstein分布鲁棒优化(DRO)与一种称为变分正则化的新型正则化形式之间的普遍联系,该正则化形式推广了全变差、Lipschitz和梯度正则化。研究证明,对于欧几里得空间与非欧几里得空间中广泛的一类非凸和非光滑损失函数,Wasserstein DRO在渐近意义上等价于变分正则化,仅存在一个微小的误差项,从而为对抗鲁棒学习提供了新的泛化保证。
Wasserstein distributionally robust optimization (DRO) has recently achieved empirical success for various applications in operations research and machine learning, owing partly to its regularization effect. Although connection between Wasserstein DRO and regularization has been established in several settings, existing results often require restrictive assumptions, such as smoothness or convexity, that are not satisfied for many problems. In this paper, we develop a general theory on the variation regularization effect of the Wasserstein DRO - a new form of regularization that generalizes total-variation regularization, Lipschitz regularization and gradient regularization. Our results cover possibly non-convex and non-smooth losses and losses on non-Euclidean spaces. Examples include multi-item newsvendor, portfolio selection, linear prediction, neural networks, manifold learning, and intensity estimation for Poisson processes, etc. As an application of our theory of variation regularization, we derive new generalization guarantees for adversarial robust learning.
研究动机与目标
- 弥合Wasserstein DRO在非凸、非光滑及非欧几里得设置下的经验成功与其正则化效应之间的理论差距。
- 建立一个统一并扩展现有正则化形式(如全变差和梯度正则化)的变分正则化的一般理论。
- 在最小假设下建立Wasserstein DRO与变分正则化之间的渐近等价性,包括1- Wasserstein DRO的情形。
- 通过将对抗鲁棒学习与损失函数局部斜率的Rademacher复杂度联系起来,推导出对抗鲁棒学习的新泛化界。
- 将现有等价结果扩展到更广泛的损失函数类别,包括分段光滑和非凸损失函数。
提出的方法
- 引入损失函数变分性的概念,定义为在数据分布的小Wasserstein扰动下,期望损失的最大变化量。
- 对于p ∈ (1, ∞]的p-Wasserstein DRO,证明其鲁棒优化问题在渐近意义上等价于一个具有d²ᵖ余项的变分正则化问题。
- 对于1-Wasserstein DRO,建立了夹逼界:鲁棒损失在调整后的调参下,上下界均由变分正则化项控制。
- 利用下等距性保证,使经验变分在高概率下逼近真实变分。
- 将该理论应用于推导对抗鲁棒学习的泛化界,表明经验与总体对抗风险之间的差距取决于损失函数局部斜率的Rademacher复杂度。
- 展示了该理论在多种场景中的适用性,包括多商品报童问题、投资组合选择、神经网络、流形学习以及点过程强度估计。
实验结果
研究问题
- RQ1Wasserstein DRO能否在非光滑或非凸损失之外,理论上与一种更一般的正则化形式相联系?
- RQ2在非光滑和非凸设置下,Wasserstein DRO与变分正则化之间的精确关系是什么?
- RQ3Wasserstein阶数p的选择如何影响正则化效果,特别是当p < 2和p = 2时?
- RQ4变分正则化理论能否为对抗鲁棒学习提供新的泛化保证?
- RQ5当经典等价结果失效时,1-Wasserstein DRO框架是否仍能控制变分?
主要发现
- 对于p ∈ (1, ∞],Wasserstein DRO在渐近意义上等价于具有d²ᵖ阶余项的变分正则化,且当p < 2时该余项是紧致的。
- 对于p = 2,该等价性在关键应用中成立,如多商品报童问题、分段线性效用的投资组合选择以及带漏失ReLu的神经网络。
- 对于1-Wasserstein DRO,夹逼定理表明,即使精确等价性不成立,最小化鲁棒损失仍能控制变分。
- 对抗鲁棒学习中的泛化误差由损失函数局部斜率的Rademacher复杂度R=(|mF|)界定,此外还包含经典项R=(F)。
- 该理论可推广至非欧几里得空间,如在流形学习中对Laplacian正则化和对Poisson过程的得分函数正则化的应用。
- 结果推广并强化了先前关于1-Wasserstein DRO的等价性结果,现涵盖非凸和非光滑损失函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。