Skip to main content
QUICK REVIEW

[论文解读] Primal Method for ERM with Flexible Mini-batching Schemes and Non-convex Losses

Dominik Csiba, Peter Richtárik|arXiv (Cornell University)|Jun 7, 2015
Stochastic Gradient Optimization Techniques参考文献 22被引用 17
一句话总结

该论文提出了一种用于正则化经验风险最小化的原始方法,支持任意的mini-batch方案和非凸损失函数,通过无对偶分析确保在平均损失为凸时的收敛性。该方法在凸损失下达到与QUARTZ相当的复杂度界,并在温和条件下首次为非凸设置提供了此类收敛保证,同时通过灵活采样实现改进的数据依赖速率。

ABSTRACT

In this work we develop a new algorithm for regularized empirical risk minimization. Our method extends recent techniques of Shalev-Shwartz [02/2015], which enable a dual-free analysis of SDCA, to arbitrary mini-batching schemes. Moreover, our method is able to better utilize the information in the data defining the ERM problem. For convex loss functions, our complexity results match those of QUARTZ, which is a primal-dual method also allowing for arbitrary mini-batching schemes. The advantage of a dual-free analysis comes from the fact that it guarantees convergence even for non-convex loss functions, as long as the average loss is convex. We illustrate through experiments the utility of being able to design arbitrary mini-batching schemes.

研究动机与目标

  • 开发一种支持任意mini-batch方案的L2正则化经验风险最小化原始方法,以实现在机器学习中高效可扩展的优化。
  • 将无对偶分析技术扩展至任意采样分布,确保在个体损失函数为非凸但平均损失为凸时的收敛性。
  • 通过问题特定的步长参数和采样概率,更好地利用数据结构,改进数据依赖的收敛速率。
  • 为迭代点和目标函数值提供理论收敛保证,而不仅仅是期望风险,从而增强实际可解释性。
  • 通过实验展示灵活mini-batching的实用性,特别是在负载均衡和NUMA感知设置下的表现。

提出的方法

  • 该方法采用无对偶分析的原始更新方案,避免依赖对偶变量,从而在更弱的假设下实现收敛性分析。
  • 它使用对数据索引的灵活采样分布,允许以任意概率 $p_i$ 独立同分布地选择mini-batch。
  • 该算法引入了依赖于数据的步长参数 $v_i$,其由范数 $\|A_i\|^2$ 导出,从而提升收敛速率。
  • 关键组件包括凸情况下的李雅普诺夫函数 $E^{(t)}$ 和非凸情况下的 $D^{(t)}$,用于通过期望递减性证明线性收敛。
  • 该方法利用个体损失函数的 $L_i$-光滑性和整体目标函数的 $L$-光滑性,推导收敛速率。
  • 通过正则化目标 $P(w)$ 的强凸性和个体 $\phi_i$ 的凸性,推导出李雅普诺夫函数期望递减的界。

实验结果

研究问题

  • RQ1只要平均损失为凸,无对偶分析的原始方法是否能对非凸损失函数实现收敛?
  • RQ2灵活的mini-batch方案(包括非均匀和数据依赖采样)如何影响经验风险最小化中的收敛速率?
  • RQ3该方法是否能在支持任意采样方式的同时,实现与QUARTZ等先进原始-对偶方法相当的收敛速率?
  • RQ4与均匀方案相比,数据依赖的步长参数 $v_i$ 对收敛速率有何影响?
  • RQ5在使用负载均衡策略(如'chunking')的分布式或NUMA环境中,该方法在实际中的表现如何?

主要发现

  • 对于凸损失函数,该方法达到收敛速率 $\max_i\left(\frac{1}{p_i} + \frac{l_i v_i}{\lambda p_i n}\right)\log\left(\frac{(L+\lambda)E^{(0)}}{\lambda\epsilon}\right)$,速率与QUARTZ一致,但数据依赖参数更优。
  • 对于平均损失为凸的非凸损失函数,该方法以 $\max_i\left(\frac{1}{p_i} + \frac{L_i^2 v_i}{\lambda^2 p_i n}\right)\log\left(\frac{(L+\lambda)D^{(0)}}{\lambda\epsilon}\right)$ 的速率保证收敛,首次提供此类无对偶收敛保证。
  • 该方法确保期望下的线性收敛,满足 $\mathbf{E}[E^{(t)}] \leq (1-\theta)^t E^{(0)}$ 和 $\mathbf{E}[D^{(t)}] \leq (1-\theta)^t D^{(0)}$,证明李雅普诺夫函数呈指数衰减。
  • 理论分析表明,该方法的收敛性依赖于数据结构,通过 $v_i = \|A_i\|^2$ 实现,其界优于均匀采样或朴素的 $l_i\|A_i\|$ 估计。
  • 实验表明,任意mini-batch的灵活性在实际中具有优势,特别是在'chunking'等负载均衡场景中,可减少空闲时间并提升吞吐量。
  • 该方法在均匀采样下达到 $O((n + \kappa)\log(1/\epsilon))$ 的复杂度,与最先进的非加速方法一致,其中 $\kappa = \frac{\max_i l_i \|A_i\|^2}{\lambda}$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。