Skip to main content
QUICK REVIEW

[论文解读] Variance Reduction for Matrix Games

Yair Carmon, Yujia Jin|arXiv (Cornell University)|Jul 3, 2019
Stochastic Gradient Optimization Techniques参考文献 43被引用 12
一句话总结

本文提出了一种随机化原始-对偶算法,通过结合Nemirovski的近端方法与一种新颖的“差值采样”梯度估计器,实现了矩阵博弈的方差缩减。该算法在 $\text{nnz}(A) + \sqrt{\text{nnz}(A)n}/\epsilon$ 时间内以 $\epsilon$-精度求解形如 $\min_x \max_y y^\top A x$ 的极小-极大问题,相较于精确梯度法和随机梯度法,在稀疏和高精度场景下实现了性能提升。

ABSTRACT

We present a randomized primal-dual algorithm that solves the problem $\min_{x} \max_{y} y^ op A x$ to additive error $ε$ in time $\mathrm{nnz}(A) + \sqrt{\mathrm{nnz}(A)n}/ε$, for matrix $A$ with larger dimension $n$ and $\mathrm{nnz}(A)$ nonzero entries. This improves the best known exact gradient methods by a factor of $\sqrt{\mathrm{nnz}(A)/n}$ and is faster than fully stochastic gradient methods in the accurate and/or sparse regime $ε\le \sqrt{n/\mathrm{nnz}(A)}$. Our results hold for $x,y$ in the simplex (matrix games, linear programming) and for $x$ in an $\ell_2$ ball and $y$ in the simplex (perceptron / SVM, minimum enclosing ball). Our algorithm combines Nemirovski's "conceptual prox-method" and a novel reduced-variance gradient estimator based on "sampling from the difference" between the current iterate and a reference point.

研究动机与目标

  • 为极小-极大优化中的方差缩减技术填补空白,该领域相较于有限和最小化问题仍发展不足。
  • 设计更快的算法求解双线性极小-极大博弈,特别是 $\ell_1$-$\ell_1$ 和 $\ell_2$-$\ell_1$ 博弈,这些博弈与矩阵博弈和SVM密切相关。
  • 在稀疏和高精度场景($\epsilon \leq \sqrt{n/\text{nnz}(A)}$)下,实现相对于非随机和完全随机梯度方法的运行时间改进。
  • 开发一类新型的“中心化”梯度估计器,其满足一个方差界条件,从而在近端方法框架下实现更快的收敛速度。

提出的方法

  • 该算法采用Nemirovski的原始概念近端方法,通过求解一系列由 $\alpha > 0$ 参数化的子问题,实现 $\epsilon$-精度。
  • 一种新颖的“差值采样”技术通过从当前迭代与参考迭代的差值中采样,构建梯度估计器,确保低方差。
  • 对于 $\ell_1$-$\ell_1$ 博弈,估计器使用与 $|y_i - y_{0,i}| / \|y - y_0\|_1$ 成比例的采样概率以减少方差。
  • 对于 $\ell_2$-$\ell_1$ 博弈,估计器以与 $([x]_j - [x_0]_j)^2 / \|x - x_0\|_2^2$ 成比例的概率采样块坐标 $j$。
  • 该方法提出了一类改进的“中心化”梯度估计器,其满足有界方差条件 $\mathbb{E}\|\tilde{g} - \nabla f(x_0,y_0)\|_*^2 \leq L^2 \|x - x_0\|^2 + L^2 \|y - y_0\|^2$,从而在近端方法框架下实现更快收敛。
  • 该算法实现了 $\text{nnz}(A) + \sqrt{\text{nnz}(A)n}/\epsilon$ 的运行时间,相较于精确梯度方法提升了 $\sqrt{\text{nnz}(A)/n}$ 倍,并在高精度/稀疏场景下优于随机方法。

实验结果

研究问题

  • RQ1能否将有限和最小化中的方差缩减技术适配到极小-极大问题中,以实现类似的运行时间改进?
  • RQ2何种梯度估计器结构可在双线性极小-极大博弈中实现低方差更新,同时保持无偏性?
  • RQ3所提出的“差值采样”策略相较于固定分布的方差缩减,在收敛速度上表现如何?
  • RQ4在使用方差缩减方法求解矩阵博弈时,采样复杂度与精度之间的最优权衡是什么?
  • RQ5近端方法框架能否扩展至使用非均匀或自适应采样策略的极小-极大问题?

主要发现

  • 所提算法在 $\text{nnz}(A) + \sqrt{\text{nnz}(A)n}/\epsilon$ 时间内以 $\epsilon$-精度求解 $\min_x \max_y y^\top A x$,相较于精确梯度方法提速了 $\sqrt{\text{nnz}(A)/n}$ 倍。
  • 在 $\epsilon \leq \sqrt{n/\text{nnz}(A)}$ 的场景下,该算法优于完全随机梯度方法,该场景对应于高精度或稀疏问题。
  • “差值采样”梯度估计器实现了方差界 $\mathbb{E}\|\tilde{g} - \nabla f(x_0,y_0)\|_*^2 \leq L^2 \|x - x_0\|^2 + L^2 \|y - y_0\|^2$,从而在近端方法框架下实现更快收敛。
  • 对于 $\ell_2$-$\ell_1$ 博弈,算法使用改进的梯度估计器并引入阈值化机制,进一步降低方差,提升收敛性能。
  • 该方法在 $\ell_1$-$\ell_1$(矩阵博弈、线性规划)和 $\ell_2$-$\ell_1$(SVM、最小包围球)设置下均适用,并具有可证明的运行时间保证。
  • 动态采样策略(46)的方差界比固定分布(45)更紧,满足 $\mathbb{E}\|\tilde{g} - g(w_0)\|_2^2 \leq \|A\|_F^2 \|w - w_0\|_2^2$,在某些场景下更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。