[论文解读] Robustified Multivariate Regression and Classification Using Distributionally Robust Optimization under the Wasserstein Metric
该论文提出了一种基于Wasserstein度量的分布鲁棒优化(DRO)框架,用于处理协变量和响应变量中的异常值,实现多变量回归与分类的鲁棒学习。通过重述最小-最大Wasserstein DRO问题,推导出一种带有矩阵范数正则化的正则化学习模型,将鲁棒性与正则化相联系。在多变量回归中,预测误差降低了7%–37%;在多分类逻辑回归中,最小扰动距离(MPD)的鲁棒性提高了100%,优于基线模型。
We develop Distributionally Robust Optimization (DRO) formulations for Multivariate Linear Regression (MLR) and Multiclass Logistic Regression (MLG) when both the covariates and responses/labels may be contaminated by outliers. The DRO framework uses a probabilistic ambiguity set defined as a ball of distributions that are close to the empirical distribution of the training set in the sense of the Wasserstein metric. We relax the DRO formulation into a regularized learning problem whose regularizer is a norm of the coefficient matrix. We establish out-of-sample performance guarantees for the solutions to our model, offering insights on the role of the regularizer in controlling the prediction error. Experimental results show that our approach improves the predictive error by 7% -- 37% for MLR, and a metric of robustness by 100% for MLG.
研究动机与目标
- 开发一种对协变量和响应变量中的异常值均具有鲁棒性的多变量学习框架。
- 将分布鲁棒优化(DRO)从单变量推广至多变量场景,特别适用于多变量线性回归(MLR)和多分类逻辑回归(MLG)。
- 通过Wasserstein度量,建立多变量情况下鲁棒性与正则化之间的理论与计算联系。
- 为所提出的鲁棒估计器在分布偏移和数据污染条件下的样本外性能提供理论保证。
- 通过实证结果证明,与标准和正则化基线方法相比,该框架在存在协变量偏移和异常值的数据集上具有更高的预测准确性和鲁棒性。
提出的方法
- 构建一个最小-最大分布鲁棒优化问题,通过在经验分布的Wasserstein模糊集上最小化最坏情况下的期望损失,实现对分布偏移的鲁棒性。
- 利用对偶性将Wasserstein DRO问题重述为带正则化的经验损失最小化问题,从而导出由数据距离度量的对偶范数决定的矩阵范数正则化项。
- 为MLR和MLG中的系数矩阵推导出一种新颖的矩阵范数正则化项,能够捕捉多个响应变量之间的几何结构与相关性。
- 将该松弛方法应用于具有Lipschitz损失的MLR和具有对数损失的MLG,实现可计算的优化,并提供数据-系数关系的对偶解释。
- 利用Wasserstein度量定义一个概率模糊集,以捕捉分布偏移和数据污染,尤其在协变量偏移下表现优异。
- 系统性地整合多变量响应,而非采用独立的单变量建模,避免简单叠加,同时保留响应之间的相关性。
实验结果
研究问题
- RQ1如何将分布鲁棒优化扩展到具有多个相关响应的多变量回归与分类问题?
- RQ2在Wasserstein度量下,多变量学习的鲁棒对偶问题具有何种结构?其与单变量DRO公式的差异是什么?
- RQ3在松弛问题中,所得正则化项与鲁棒性有何关系?其在系数矩阵空间中的几何解释是什么?
- RQ4与标准和正则化基线相比,该框架是否能在数据污染和协变量偏移下实现更优的样本外性能和鲁棒性?
- RQ5所提出方法在预测准确性和对抗鲁棒性方面的实证影响如何,特别是在最小扰动距离(MPD)方面的表现?
主要发现
- 在异常值污染条件下,所提出的MLR模型相比标准多变量回归,预测误差降低了7%–37%。
- 在多分类逻辑回归中,MLG-SR和MLG-1S模型在最小扰动距离(MPD)上实现了100%的提升,表明对输入扰动具有显著更高的鲁棒性。
- 尽管未显式建模预测变量之间的相关性,MLG-1S模型在正确分类率(CCR)上优于PCC MLG 12%,在对数损失上提升13%,在CVaR上提升16%。
- 该方法通过将正则化项与分布偏移下的最坏情况风险相联系,为样本外性能提供了理论保证。
- 从Wasserstein DRO框架中导出的矩阵范数正则化项,能有效捕捉多变量依赖关系,并在不显式建模响应相关性的情况下实现高效优化。
- 实证结果表明,基于优化的方法优于显式建模响应或预测变量相关性的统计方法,尤其在协变量偏移和数据污染条件下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。