Skip to main content
QUICK REVIEW

[論文レビュー] Accelerated Coordinate Descent with Arbitrary Sampling and Best Rates for Minibatches

Filip Hanzely, Peter Richtárik|arXiv (Cornell University)|Sep 25, 2018
Distributed Sensor Networks and Detection Algorithms被引用数 20
ひとこと要約

本稿では、任意のサンプリングを許容する加速座標勾配(ACD)法を導入し、座標ごとのリプシッツ定数を活用することで、新たな重要度サンプリングルールにより最適なミニバッチ選択を可能にした。この手法は、均一サンプリングよりも最大でO(n/τ)速い収束を保証し、大規模な機械学習問題において顕著な性能向上を達成する。

ABSTRACT

Accelerated coordinate descent is a widely popular optimization algorithm due to its efficiency on large-dimensional problems. It achieves state-of-the-art complexity on an important class of empirical risk minimization problems. In this paper we design and analyze an accelerated coordinate descent (ACD) method which in each iteration updates a random subset of coordinates according to an arbitrary but fixed probability law, which is a parameter of the method. If all coordinates are updated in each iteration, our method reduces to the classical accelerated gradient descent method AGD of Nesterov. If a single coordinate is updated in each iteration, and we pick probabilities proportional to the square roots of the coordinate-wise Lipschitz constants, our method reduces to the currently fastest coordinate descent method NUACDM of Allen-Zhu, Qu, Richt\\'{a}rik and Yuan. While mini-batch variants of ACD are more popular and relevant in practice, there is no importance sampling for ACD that outperforms the standard uniform mini-batch sampling. Through insights enabled by our general analysis, we design new importance sampling for mini-batch ACD which significantly outperforms previous state-of-the-art minibatch ACD in practice. We prove a rate that is at most ${\\cal O}(\\sqrt{\ au})$ times worse than the rate of minibatch ACD with uniform sampling, but can be ${\\cal O}(n/\ au)$ times better, where $\ au$ is the minibatch size. Since in modern supervised learning training systems it is standard practice to choose $\ au \\ll n$, and often $\ au={\\cal O}(1)$, our method can lead to dramatic speedups. Lastly, we obtain similar results for minibatch nonaccelerated CD as well, achieving improvements on previous best rates.

研究の動機と目的

  • 各反復で座標の任意のサンプリングをサポートする加速座標勾配法を設計すること。これは、既存の手法を一般化する。
  • ミニバッチACDのための最適な重要度サンプリング戦略を導出すること。これは実用的に均一サンプリングを上回る。
  • 特にミニバッチサイズτが小さい場合に、従来の最先端手法よりも明確に優れた収束レートを確立すること。
  • ロジスティック回帰やSVMのような実世界の機械学習問題において、提案手法の実用的優位性を示すこと。
  • ミニバッチ化を伴う加速および非加速座標勾配の両方の分析を拡張すること。

提案手法

  • 各反復で座標サブセット(ミニバッチ)を固定された確率法により選択する。これは、単一座標勾配法およびフル勾配法の両方を一般化する。
  • 座標ごとのリプシッツ定数の平方根に比例する確率でサンプリングする、新たな重要度サンプリングスキームを導入する。
  • ネステロフ風のモーメンタムを採用し、収束の加速に寄与するモーメンタム変数を維持する。
  • 任意のサンプリングを扱うために、新規のリャプノフ関数とESO(期待分離近似)フレームワークに基づく収束解析を実施する。
  • 非加速バージョンに対しても、類似した重要度サンプリングルールを導出し、既存の非加速ミニバッチCDレートを改善する。
  • 滑らかで強く凸な目的関数をサポートし、反復複雑度に関する理論的保証を提供する。

実験結果

リサーチクエスチョン

  • RQ1座標サブセットの任意のサンプリングを許容しつつ、最適な収束レートを維持できる加速座標勾配法を設計できるか?
  • RQ2ミニバッチACDの最適な重要度サンプリング戦略は何か?これは均一サンプリングを上回る。
  • RQ3特にτ ≪ nの場合に、提案手法の収束レートはミニバッチサイズτにどのように依存するか?
  • RQ4理論的な改善が、ロジスティック回帰やSVMのような実世界の機械学習問題で実証的に確認できるか?
  • RQ5収束速度の観点から、ミニバッチサンプリング戦略と問題の条件数の関係は何か?

主な発見

  • 提案されたACD法は、均一サンプリングより最大でO(√τ)倍悪くなる可能性があるが、サンプリング分布に応じてO(n/τ)倍速くなる可能性がある。
  • ミニバッチサイズτ ≪ nの場合、重要度サンプリングを用いることで実際の実行で顕著な高速化が達成される。
  • リプシッツ定数の平方根に基づく重要度サンプリングルールは、ミニバッチACDにおいて既存の最高レートを達成し、先行研究を上回る。
  • ロジスティック回帰およびSVM問題における実験結果から、重要度サンプリングによる一貫した高速化が確認され、特に汚染済みまたは悪条件のデータにおいて顕著である。
  • 全テストデータセットおよび全ミニバッチサイズにおいて、標準的な均一ミニバッチ化や先行の最先端ACD手法を上回る性能を示す。
  • 理論的収束レートは文献で知られている最高レートと一致しており、本手法は古典的なAGDおよびNUACDMを特別なケースとして包含する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。