Skip to main content
QUICK REVIEW

[论文解读] Dual Free SDCA for Empirical Risk Minimization with Adaptive Probabilities

Xi He, Martin Takáč|arXiv (Cornell University)|Oct 22, 2015
Stochastic Gradient Optimization Techniques参考文献 22被引用 6
一句话总结

本文提出在正则化经验风险最小化问题中采用自适应概率选择的双对偶自由SDCA方法,通过动态优先选择最有可能降低次优性的对偶坐标,实现更快收敛。通过引入时变的、非均匀的概率分布,该方法在收敛性上优于均匀选择策略,实验结果也表明其在实际应用中效率更优。

ABSTRACT

In this paper we develop free SDCA with adaptive probabilities for regularized empirical risk minimization. This extends recent work of Shai Shalev-Shwartz [SDCA without Duality, arXiv:1502.06177] to allow non-uniform selection of dual coordinate in SDCA. Moreover, the probability can change over time, making it more efficient than uniform selection. Our work focuses on generating adaptive probabilities through iterative process, preferring to choose coordinate with highest potential to decrease sub-optimality. We also propose a practical variant Algorithm adfSDCA+ which is more aggressive. The work is concluded with multiple experiments which shows efficiency of proposed algorithms.

研究动机与目标

  • 将双对偶自由SDCA扩展至支持非均匀且自适应的对偶坐标选择,以提升收敛效率。
  • 解决SDCA中均匀坐标选择的局限性,该局限性在实践中可能减缓收敛速度。
  • 开发一种基于对次优性降低潜力的估计,动态调整概率的方法。
  • 提出一种实用变体adfSDCA+,通过更激进的概率更新策略实现更快收敛。
  • 通过实证验证自适应概率选择在真实世界经验风险最小化问题中的效率。

提出的方法

  • 通过迭代生成自适应概率,优先选择预期能最大程度降低次优性的对偶坐标。
  • 通过用非均匀、时变的概率分布替代均匀坐标选择,扩展了双对偶自由SDCA方法。
  • 基于各坐标估计的进展进行概率更新,优先选择具有更高潜在改进空间的坐标。
  • 算法采用无对偶形式,避免了显式计算对偶间隙的需要。
  • 实用变体adfSDCA+采用更激进的概率更新策略,以加速收敛。
  • 该方法基于对选择概率的迭代优化,由次优性降低估计引导。

实验结果

研究问题

  • RQ1在双对偶自由SDCA中,采用非均匀且自适应的概率选择是否能比均匀选择实现更快收敛?
  • RQ2如何在优化过程中高效且有效地计算自适应概率,以优先选择高影响力坐标?
  • RQ3时变概率对正则化经验风险最小化中收敛速度有何影响?
  • RQ4所提出的adfSDCA+变体与标准双对偶自由SDCA在实际性能上相比如何?
  • RQ5自适应策略是否能在多种经验风险最小化问题中持续优于均匀选择?

主要发现

  • 所提出的自适应概率方法通过聚焦于次优性降低潜力最高的坐标,实现了比双对偶自由SDCA中均匀选择更快的收敛速度。
  • 概率的时间变异性使算法能够在优化过程中自适应地改进其选择策略。
  • 实用变体adfSDCA+表现出更优的性能,表明更激进的概率更新策略可提升收敛速度。
  • 实验结果证实,该自适应方法在多个经验风险最小化任务中均比均匀选择更高效。
  • 该方法成功将双对偶自由SDCA扩展至支持非均匀坐标选择,且无需计算对偶间隙。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。