Skip to main content
QUICK REVIEW

[論文レビュー] Doubly Stochastic Primal-Dual Coordinate Method for Empirical Risk Minimization and Bilinear Saddle-Point Problem

Adams Wei Yu, Qihang Lin|arXiv (Cornell University)|Aug 14, 2015
Stochastic Gradient Optimization Techniques参考文献 50被引用数 8
ひとこと要約

本稿では、経験的リスク最小化を双線形サドルポイント問題に再定式化し、ドーバー・スチューディアスティック・プライマル・デュアル・コORDINATE(DSPDC)法を提案する。反復毎にプライマルおよびデュアル変数のブロックを確率的にサンプリングすることにより、データに要因分解構造がある場合や、プロキシマルマッピングが高価な場合に、既存の手法よりも低い反復複雑性を達成する。収束は、目的関数ギャップおよび最適解からの距離の両面で保証されている。

ABSTRACT

We proposed a doubly stochastic primal-dual coordinate (DSPDC) optimization algorithm for empirical risk minimization, which can be formulated as a bilinear saddle-point problem. In each iteration, our method randomly samples a block of coordinates of the primal and dual solutions to update. The convergence of our method is established in both the distance from the current iterate to the optimal solution and the primal-dual objective gap. We show that the proposed method has a lower overall complexity than existing coordinate methods when either the data matrix has a factorized structure or the proximal mapping on each block is computationally expensive, e.g., involves an eigenvalue decomposition. Furthermore, we give a theoretical lower bound on the iteration complexity of a general family of primal-dual (block) coordinate methods for bilinear saddle-point problems, which also includes DSPDC.

研究の動機と目的

  • 大規模データにスケーリングする効率的な最適化手法を開発すること。
  • 特に固有値分解などの高価な演算を要する場合に、ブロック座標法におけるプロキシマルマッピングの高い計算コストを扱うこと。
  • データ構造や高価なプロキシマル操作を活用することで、既存の座標法と比較して、全体の反復複雑性を低減すること。
  • プライマル・デュアル目的関数ギャップおよび最適解からの距離の両面で、理論的収束保証を確立すること。

提案手法

  • 経験的リスク最小化を、プライマルおよびデュアル変数を含む双線形サドルポイント問題として定式化する。
  • 各反復で、プライマルおよびデュアル座標のブロックを確率的に選択して更新することで、大規模計算を効率的に行う。
  • サドルポイント構造に従って誘導される、プライマルおよびデュアル変数の両方に対するブロック座標降下法を採用する。
  • 反復コストを低減しつつ、ややいなごろの仮定の下で収束を維持するため、座標ブロックの確率的サンプリングを用いる。
  • 計算が可能である場合に限り、各ブロックにおけるプロキシマルマッピングを効率的に更新する。
  • 収束は、プライマル・デュアル目的関数ギャップおよび現在の反復点から最適解までの距離の両面で分析される。

実験結果

リサーチクエスチョン

  • RQ1二重確率的プライマル・デュアル座標法は、経験的リスク最小化において、既存の手法よりも低い反復複雑性を達成できるか?
  • RQ2データ行列に要因分解構造がある場合、この手法はどのように動作するか?
  • RQ3一般のプライマル・デュアルブロック座標法のクラスに対して、反復複雑性の理論的下界は何か?
  • RQ4各ブロックにおけるプロキシマルマッピングが計算的に高価な場合でも、この手法は収束を維持できるか?
  • RQ5確率的ブロックサンプリング戦略は、収束速度および全体の複雑性にどのように影響するか?

主な発見

  • データ行列に要因分解構造がある場合、DSPDCは既存の座標法よりも低い全体の反復複雑性を達成する。
  • 特に固有値分解を要するような、ブロックにおけるプロキシマルマッピングが高価な場合、効率性が向上する。
  • プライマル・デュアル目的関数ギャップおよび現在の反復点から最適解までの距離の両面で収束が確立されている。
  • 一般クラスのプライマル・デュアル(ブロック)座標法(DSPDCを含む)に対して、反復複雑性の理論的下界が導出された。
  • ブロック単位のプロキシマル操作が高価であるか、データに低ランク構造がある場合に特に有利である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。