Skip to main content
QUICK REVIEW

[论文解读] Variance-based regularization with convex objectives

John C. Duchi, Hongseok Namkoong|arXiv (Cornell University)|Oct 8, 2016
Risk and Portfolio Optimization被引用 21
一句话总结

本文提出了一种凸的、可计算的正则化方法,通过利用分布鲁棒优化和欧文的经验似然,近似基于方差的风险最小化。该方法通过平衡偏差与方差,实现了比经验风险最小化更快的收敛速率,具有理论保证,并通过实证验证显示出更好的泛化性能。

ABSTRACT

We develop an approach to risk minimization and stochastic optimization that provides a convex surrogate for variance, allowing near-optimal and computationally efficient trading between approximation and estimation error. Our approach builds off of techniques for distributionally robust optimization and Owen's empirical likelihood, and we provide a number of finite-sample and asymptotic results characterizing the theoretical performance of the estimator. In particular, we show that our procedure comes with certificates of optimality, achieving (in some scenarios) faster rates of convergence than empirical risk minimization by virtue of automatically balancing bias and variance. We give corroborating empirical evidence showing that in practice, the estimator indeed trades between variance and absolute performance on a training sample, improving out-of-sample (test) performance over standard empirical risk minimization for a number of classification problems.

研究动机与目标

  • 开发一种方差的凸代理,以实现高效计算,同时平衡近似误差与估计误差。
  • 为非凸的方差正则化风险最小化提供一个理论上合理的替代方案,后者在实践中计算上不可行。
  • 通过有原则地权衡偏差与方差,提升泛化性能,特别是在有限样本设置下。
  • 为所提出的鲁棒正则化估计器建立有限样本和渐近收敛保证。
  • 通过实证表明,该方法在分类任务中优于标准的经验风险最小化。

提出的方法

  • 该方法采用分布鲁棒优化框架,以经验分布为中心的χ²-散度邻域来定义鲁棒风险函数。
  • 将鲁棒风险表述为在经验测度ρ-半径χ²球内的分布上期望损失的上确界,当损失函数为凸时,可保证凸性。
  • 证明鲁棒风险是总体风险的紧致O(1/n)近似,其主导项包含一个方差校正的经验风险和一个较小的负误差项。
  • 通过对偶分解求解优化问题,将其简化为对偶变量λ的一维凸优化问题,可通过二分查找求解。
  • 关键子程序通过排序后的损失值和累积和计算最优概率权重,使每次迭代的时间复杂度达到O(log n)。
  • 该算法通过两阶段过程高效计算样本点上的最优分布:首先确定活动索引集,然后通过二分查找求解偏移参数η。

实验结果

研究问题

  • RQ1能否构建一种方差正则化用的凸代理,以保持理论最优性并具备计算可处理性?
  • RQ2所提出的鲁棒风险公式是否通过平衡偏差与方差,实现了比经验风险最小化更快的收敛速率?
  • RQ3与标准的经验风险最小化相比,鲁棒正则化估计器在有限样本设置下的表现如何?
  • RQ4在近似质量方面,鲁棒风险与方差校正的经验风险(3)之间存在何种关系?
  • RQ5该方法能否以低计算开销高效实现,特别是在高维或大规模设置下?

主要发现

  • 鲁棒风险 $ R_n(\theta, \rho) $ 是总体风险的 $ O(1/n) $-近似,显著优于经验风险最小化的 $ O(1/\sqrt{n}) $-界。
  • 在某些场景下,该方法通过自动平衡偏差与方差,实现了比经验风险最小化更快的收敛速率。
  • 证明鲁棒风险是方差正则化风险(3)的紧密近似,其误差项 $ \rho_n(\theta) \leq 0 $ 为 $ O_P(1/n) $,当方差较大时以高概率趋于零。
  • 实证结果表明,与标准的经验风险最小化相比,该方法在多个分类问题上表现出更优的泛化性能。
  • 优化过程计算高效,排序损失值后,仅需 $ O(\log(1/\epsilon) \cdot \log n) $ 时间,具有良好的可扩展性。
  • 该方法提供最优性证书,适用于任意凸损失函数,确保整体目标函数的凸性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。