Skip to main content
QUICK REVIEW

[论文解读] Sinkhorn Distributionally Robust Optimization

Jie Wang, Rui Gao|arXiv (Cornell University)|Sep 24, 2021
Risk and Portfolio Optimization参考文献 70被引用 7
一句话总结

本文提出Sinkhorn分布鲁棒优化(DRO),这是一种新颖的DRO框架,利用Sinkhorn距离——一种正则化的Wasserstein距离——实现一般损失函数和传输成本下的凸对偶重构。通过带偏差梯度预言机的随机镜像下降算法,该方法实现了近乎最优的样本复杂度,在计算可及性和建模合理性方面优于Wasserstein DRO,同时保持了经验风险最小化所具备的样本效率。

ABSTRACT

We study distributionally robust optimization with Sinkhorn distance -- a variant of Wasserstein distance based on entropic regularization. We derive a convex programming dual reformulation for general nominal distributions, transport costs, and loss functions. To solve the dual reformulation, we develop a stochastic mirror descent algorithm with biased subgradient estimators and derive its computational complexity guarantees. Finally, we provide numerical examples using synthetic and real data to demonstrate its superior performance.

研究动机与目标

  • 为解决Wasserstein DRO在一般损失函数和连续支撑下的计算不可行性与建模过度保守问题。
  • 开发一种DRO框架,在保持计算可及性的同时,生成比传统Wasserstein DRO更合理的最坏情况分布。
  • 在平滑与非平滑损失函数下,实现接近经验风险最小化性能的样本复杂度。
  • 提供基于对偶的Sinkhorn DRO重构,以支持高效的随机优化。

提出的方法

  • 利用熵正则化,推导出适用于一般名义分布、传输成本和损失函数的Sinkhorn DRO的凸规划对偶重构。
  • 提出一种带偏差梯度预言机的随机镜像下降(SMD)算法,以求解对偶形式。
  • 采用两种采样方案——随机梯度(SG)与随机多级蒙特卡洛(RT-MLMC)——以控制梯度偏差与方差。
  • 使用带不精确预言机的二分查找法优化对偶变量(Lagrangian乘子),利用Lipschitz连续性与次梯度界。
  • 提出一种批量大小选择策略 $ m = \lceil \log_2(1/\eta) \rceil $,以最小化总计算成本。
  • 建立样本复杂度的理论界,显示SG为 $ \mathcal{O}(\delta^{-3} \log(1/\eta)) $,RT-MLMC为 $ \widetilde{\mathcal{O}}(\delta^{-2} \log(1/\eta)) $,几乎与经验风险最小化的最优值 $ \mathcal{O}(\delta^{-2}) $ 相当。

实验结果

研究问题

  • RQ1Sinkhorn DRO能否为一般损失函数与传输成本提供比Wasserstein DRO更计算可行且更不保守的替代方案?
  • RQ2在Sinkhorn DRO中使用熵正则化是否能产生比Wasserstein DRO中离散最坏情况度量更合理的最坏情况分布?
  • RQ3带偏差预言机的随机镜像下降算法能否在Sinkhorn DRO中实现接近最优的样本复杂度,达到与经验风险最小化相当的性能?
  • RQ4在不同采样方案下,如何确定最小化总计算成本的最优批量大小策略?

主要发现

  • 所提出的Sinkhorn DRO框架实现了适用于一般损失函数、传输成本与名义分布的凸对偶重构,支持高效优化。
  • 采用SG与RT-MLMC方案的随机镜像下降算法,分别实现了 $ \mathcal{O}(\delta^{-3} \log(1/\eta)) $ 与 $ \widetilde{\mathcal{O}}(\delta^{-2} \log(1/\eta)) $ 的样本复杂度,几乎与经验风险最小化的最优值 $ \mathcal{O}(\delta^{-2}) $ 相当。
  • 在Sinkhorn DRO下,最坏情况分布比Wasserstein DRO中的离散最坏情况度量更合理,尤其当真实分布为连续时更为显著。
  • 最优批量大小 $ m = \lceil \log_2(1/\eta) \rceil $ 能够最小化总计算成本,实现偏差与方差的平衡。
  • 理论分析证实,对偶目标函数是凸的且Lipschitz连续,支持使用不精确预言机的高效二分查找。
  • 在合成数据与真实数据上的数值实验表明,Sinkhorn DRO在鲁棒性与计算效率方面均优于Wasserstein DRO。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。