Skip to main content
QUICK REVIEW

[論文レビュー] On Coresets for Logistic Regression

Alexander Munteanu, Chris Schwiegelshohn|arXiv (Cornell University)|May 22, 2018
Face and Expression Recognition参考文献 43被引用数 20
ひとこと要約

この論文は、有界な $\mu$-複雑性条件下で最初の証明可能な部分線形 $(1\pm\varepsilon)$-コアセットを実現する、ロジスティック回帰のための新規感度サンプリング方式を導入する。一般には強い部分線形コアセットが存在しないことが示され、しかし、正しくと誤って推定されたオッズの比を測る $\mu$-複雑性が低いデータに対しては、$\ell_2^2$ レバレッジスコアと一様混合に基づく感度サンプリングにより、強力な近似保証を得られる部分線形コアセットサイズが達成可能である。

ABSTRACT

Coresets are one of the central methods to facilitate the analysis of large data sets. We continue a recent line of research applying the theory of coresets to logistic regression. First, we show a negative result, namely, that no strongly sublinear sized coresets exist for logistic regression. To deal with intractable worst-case instances we introduce a complexity measure $μ(X)$, which quantifies the hardness of compressing a data set for logistic regression. $μ(X)$ has an intuitive statistical interpretation that may be of independent interest. For data sets with bounded $μ(X)$-complexity, we show that a novel sensitivity sampling scheme produces the first provably sublinear $(1\pm\varepsilon)$-coreset. We illustrate the performance of our method by comparing to uniform sampling as well as to state of the art methods in the area. The experiments are conducted on real world benchmark data for logistic regression.

研究の動機と目的

  • 大規模データセットにおけるロジスティック回帰のスケーリングという根本的課題に、データコアセット構築によって対処すること。
  • コアセットサイズの理論的限界を同定し、一般には強い部分線形コアセットが存在しないことを示すこと。
  • ロジスティック回帰データセットの圧縮可能性を測る新しい複雑性測度 $\mu(X)$ を導入すること。
  • $\mu$-複雑なデータセットに対して部分線形コアセットサイズを達成する感度ベースのサンプリング方式を設計すること。
  • 実世界のベンチマークにおいて、一様サンプリングおよび $k$-means-ベースのサンプリングと比較して、手法の実験的妥当性を検証すること。

提案手法

  • ロジスティック回帰のためのデータ圧縮可能性を測るため、正しく推定されたオッズの対数と誤って推定されたオッズの対数の比として定義される新しい複雑性測度 $\mu(X)$ を導入する。
  • 高影響度および低影響度のデータポイントの両方を処理できるように、$\ell_2^2$ レバレッジスコア(平方根)と一様サンプリングを組み合わせたハイブリッドサンプリング分布を提案する。
  • 合計感度が $\mu(X)$ の観点で有界であることを確立し、$\mu$-複雑なデータに対しては、$(1\pm\varepsilon)$-コアセットをサイズ $O(\mu \cdot d \cdot \varepsilon^{-2} \cdot \log \mu)$ で構築可能であることを示す。
  • 入力スパarsity時間 $\tilde{O}(\mathtt{nnz}(Z))$ で実行され、ストリーミングおよび分散モデル(例:MapReduce)をサポートする空間効率の良いアルゴリズムを導出する。
  • 再帰的コアセット構築を用いて、任意の $\eta > 0$ に対してコアセットサイズを $n^\eta$ にまで削減し、ストリーミング環境ではたった $2\log(1/\eta)$ パasses で実現可能である。
  • 感度フレームワークを用い、形式的なコアセット保証を提供する:任意の解 $\beta$ に対して、コアセットの目的関数が全データの目的関数を $1\pm\varepsilon$ の範囲で近似する。

実験結果

リサーチクエスチョン

  • RQ1一般条件下で、ロジスティック回帰に対して部分線形サイズのコアセットを構築することは可能か?
  • RQ2ロジスティック回帰データが効果的に圧縮可能である状況を特徴付ける複雑性測度は何か?
  • RQ3感度サンプリングは、非二次的かつ非凸な損失構造を示すロジスティック回帰にどのように適応可能か?
  • RQ4一様サンプリングと $\ell_2^2$ レバレッジスコアに基づくハイブリッドサンプリング戦略は、実際の性能で標準ベースラインを上回るか?
  • RQ5提案手法は、最悪ケースを越えた複雑性モデル下で、証明可能な部分線形コアセットサイズを達成できるか?

主な発見

  • 最悪ケースでは、ロジスティック回帰に対して強い部分線形コアセットは存在しないことが示され、根本的な否定的結果が得られた。
  • 有界な $\mu$ を持つ $\mu$-複雑なデータセットに対して、提案された感度サンプリング方式により、$(1\pm\varepsilon)$-コアセットをサイズ $O(\mu \cdot d \cdot \varepsilon^{-2} \cdot \log \mu)$ で生成可能であり、これは $n$ に対して証明可能な部分線形である。
  • Webb Spam、Covertype、KDD Cup '99 といった実世界データでの実験により、提案手法は一様サンプリングおよび $k$-means-ベースのサンプリングを上回る性能を示し、対数尤度誤差と実行時間の両面で優れている。
  • 全テストデータセットおよびコアセットサイズにおいて、相対的対数尤度誤差の標準偏差が 0.05 未満に抑えられ、中央値の相対的実行時間は全データ最適化の 0.2x 未満であった。
  • 一様サンプリングは、分離可能または近似分離可能なデータでは崩壊的に失敗する。SGD 実験では、半数の実行で $\beta_1$ 値が 100 を超え、結果として劣悪な近似比が得られた。
  • 再帰的コアセット構築により、任意の $\eta > 0$ に対してコアセットサイズを $n^\eta$ にまで削減でき、ストリーミング環境ではたった $2\log(1/\eta)$ パasses で実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。