Skip to main content
QUICK REVIEW

[論文レビュー] Discrepancy, Coresets, and Sketches in Machine Learning

Zohar Karnin, Edo Liberty|arXiv (Cornell University)|Jun 11, 2019
Machine Learning and Algorithms参考文献 22被引用数 7
ひとこと要約

本稿では、機械学習におけるクラス差分とコアセット・スケッチの複雑さを結びつける一般化されたフレームワークを提示する。低差分関数族がロジスティック回帰、カーネル密度推定、その他の解析関数に対して、サイズ $O(\sqrt{d}/\epsilon)$ の小さなコアセットを許容することを証明する。低差分列を構築する決定的アルゴリズムを提示し、新たなマージ・アンド・リダクション最適化によりストリーミングスケッチを改善する。

ABSTRACT

This paper defines the notion of class discrepancy for families of functions. It shows that low discrepancy classes admit small offline and streaming coresets. We provide general techniques for bounding the class discrepancy of machine learning problems. As corollaries of the general technique we bound the discrepancy (and therefore coreset complexity) of logistic regression, sigmoid activation loss, matrix covariance, kernel density and any analytic function of the dot product or the squared distance. Our results prove the existence of epsilon-approximation O(sqrt{d}/epsilon) sized coresets for the above problems. This resolves the long-standing open problem regarding the coreset complexity of Gaussian kernel density estimation. We provide two more related but independent results. First, an exponential improvement of the widely used merge-and-reduce trick which gives improved streaming sketches for any low discrepancy problem. Second, an extremely simple deterministic algorithm for finding low discrepancy sequences (and therefore coresets) for any positive semi-definite kernel. This paper establishes some explicit connections between class discrepancy, coreset complexity, learnability, and streaming algorithms.

研究の動機と目的

  • クラス差分と機械学習におけるコアセット複雑さとの理論的関係を確立すること。
  • ロジスティック回帰やカーネル密度推定を含む、解析関数族全体の差分をバインドする一般化手法を提供すること。
  • ガウスカーネル密度推定におけるコアセット複雑さに関する長年の未解決問題を解消すること。
  • 差分理論を用いてマージ・アンド・リダクション技法を改善し、ストリーミングスケッチを向上させること。
  • 正定値カーネルに対して、低差分列を決定的に構築する効率的アルゴリズムを開発すること。

提案手法

  • コアセット複雑さの指標としてクラス差分を定義し、最適なコアセット構築に適した、ラダマッハ複雑度に類似したが、それに特化した測度とする。
  • バナシュチックの定理を適用し、カーネル関数上の符号付き和を用いて関数族の差分をバインドする。
  • データポイントに符号 $\sigma_i \in \{-1,1\}$ を割り当て、すべてのクエリにおけるカーネル和の最大偏差を最小化する、グリーディで決定的なアルゴリズムを導入する。
  • 差分バインド $\max_q |\sum_i \sigma_i K(x_i, q)| \leq \sqrt{m}$ を用い、$\epsilon$-ネット上の和集合によるバインドによりコアセット保証を導出する。
  • 差分に配慮した再帰的マージ戦略を用いてマージ・アンド・リダクション技法を強化し、ストリーミング環境におけるメモリ使用量を削減する。
  • カーネル写像によって誘導されるベクトル空間におけるノルム成長が有界であることを保証するため、$K(x,x) \leq 1$ および $K$ が正定値であるという事実を活用する。

実験結果

リサーチクエスチョン

  • RQ1クラス差分は、多様な機械学習問題におけるコアセット複雑さを統一的に測る指標として機能できるか?
  • RQ2特にガウスカーネルに対して、$\epsilon$-近似を達成するための最小コアセットサイズは何か?
  • RQ3差分理論を用いて、ストリーミングスケッチにおけるマージ・アンド・リダクション技法をどのように改善できるか?
  • RQ4正定値カーネルに対して、低差分列を決定的にかつ効率的に構築するアルゴリズムは存在するか?
  • RQ5差分バインドを用いることで、VC次元や感度に基づく手法に比べて、よりタイトなコアセットサイズ保証を得られるか?

主な発見

  • 本稿では、ロジスティック回帰、シグモイド損失、行列共分散、カーネル密度推定に対して、$O(\sqrt{d}/\epsilon)$ サイズのコアセットが存在することを証明する。
  • ガウスカーネル密度推定に対しては、未解決問題を解消し、次元に依存しない $O(1/\epsilon^2)$ サイズのコアセットで十分であることを示す。
  • 正定値カーネルに対して提案された決定的アルゴリズムは、$\max_q |\sum_i \sigma_i K(x_i, q)| \leq \sqrt{m}$ を達成するが、これは最悪ケースで最適である。
  • 改善されたマージ・アンド・リダクション手法により、メモリ複雑度が $O(m^2)$ から $O(m)$ に低下し、効率的なストリーミングスケッチが可能になる。
  • L-リプシッツカーネルに対しては、確率的ストリーミングアルゴリズムが、高確率で $O(\log^3(d \log(RLn/\delta\epsilon))/\epsilon^2)$ のメモリ複雑度を達成する。
  • 理論的境界により、多くの場合においてVC次元や感度に基づく手法に比べ、差分に基づくコアセットサイズが著しく小さいことが示される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。