Skip to main content
QUICK REVIEW

[論文レビュー] Streaming Algorithms from Precision Sampling

Alexandr Andoni, Robert Krauthgamer|arXiv (Cornell University)|Nov 4, 2010
Machine Learning and Algorithms参考文献 26被引用数 20
ひとこと要約

本稿では、精度サンプリング補題(PSL)を用いた統一的な枠組みを導入し、$F_k$-モーメント($k>2$)、$\Vert x\rVert_p$-ノルム($p \in [1,2]$)、カスケードノルム、および$\ell_p$-サンプリングの最適な空間計算量を達成する効率的なストリーミングアルゴリズムの設計を可能にする。PSLから得られるランダムな重みで入力ベクトルをスケーリングし、ヘビーハイター推定器を適用することで、単純で一般化可能なアルゴリズムにより、ほぼ最適な空間バウンドを達成する。

ABSTRACT

A technique introduced by Indyk and Woodruff [STOC 2005] has inspired several recent advances in data-stream algorithms. We show that a number of these results follow easily from the application of a single probabilistic method called Precision Sampling. Using this method, we obtain simple data-stream algorithms that maintain a randomized sketch of an input vector $x=(x_1,...x_n)$, which is useful for the following applications. 1) Estimating the $F_k$-moment of $x$, for $k>2$. 2) Estimating the $\ell_p$-norm of $x$, for $p\in[1,2]$, with small update time. 3) Estimating cascaded norms $\ell_p(\ell_q)$ for all $p,q>0$. 4) $\ell_1$ sampling, where the goal is to produce an element $i$ with probability (approximately) $|x_i|/\|x\|_1$. It extends to similarly defined $\ell_p$-sampling, for $p\in [1,2]$. For all these applications the algorithm is essentially the same: scale the vector x entry-wise by a well-chosen random vector, and run a heavy-hitter estimation algorithm on the resulting vector. Our sketch is a linear function of x, thereby allowing general updates to the vector x. Precision Sampling itself addresses the problem of estimating a sum $\sum_{i=1}^n a_i$ from weak estimates of each real $a_i\in[0,1]$. More precisely, the estimator first chooses a desired precision $u_i\in(0,1]$ for each $i\in[n]$, and then it receives an estimate of every $a_i$ within additive $u_i$. Its goal is to provide a good approximation to $\sum a_i$ while keeping a tab on the "approximation cost" $\sum_i (1/u_i)$. Here we refine previous work [Andoni, Krauthgamer, and Onak, FOCS 2010] which shows that as long as $\sum a_i=Ω(1)$, a good multiplicative approximation can be achieved using total precision of only $O(n\log n)$.

研究の動機と目的

  • 従来、インディーク=ウッドラフ手法に依存して構築されていた複雑なストリーミングアルゴリズムの広いクラスを、よりモジュラーかつ再利用可能な枠組みへ簡略化すること。
  • 基本的な問題(例:$F_k$-モーメント推定、$\ell_p$-ノルム推定)のための空間効率的なストリーミングアルゴリズムを設計するための汎用的かつモジュラーなアプローチを提供すること。
  • 精度サンプリング補題を精緻化することで、特に$F_k$-モーメントおよび$\ell_p$-ノルム推定の分野において、既存の問題の空間バウンドを改善すること。
  • サンプリングステップ(PSLによるランダムスケーリング)とヘビーハイター推定ステップの明確な分離を確立し、モジュラーな設計と解析を可能にすること。
  • カスケードノルムおよび$\ell_p$-サンプリング($p \in [1,2]$)といった新たな問題への枠組みの適用範囲を拡張すること。

提案手法

  • 入力ベクトル$x$の各座標に、PSLを適用してランダムな精度レベルを割り当てることで、$\sum a_i$の良い近似を保ちつつ、逆精度の和を最小化する。
  • PSLから得られるランダムベクトルにより、入力ベクトル$x$を要素ごとにスケーリングし、問題をスケーリングされたベクトルにおけるヘビーハイターの推定問題に変換する。
  • スケーリングされたベクトルに対して、標準的なヘビーハイター推定アルゴリズム(例:Count-Minスケッチ、Misra-Gries)を適用して、$x$の関数を推定する。
  • スケッチの線形性を活用し、ストリーム上で任意の符号を持つ更新(一般の更新)をサポートする。
  • PSLを精緻化することで、$\sum a_i = \Omega(1)$のとき、合計近似コストを$O(n \log n)$に抑え、先行研究を改善する。
  • 確率的議論とクエリ計算量の下界を用いて、得られた空間バウンドがほぼ最適であることを証明する。

実験結果

リサーチクエスチョン

  • RQ1複雑なインディーク=ウッドラフ手法に基づく$F_k$-モーメント推定を、よりモジュラーや再利用可能な枠組みに簡略化できるか?
  • RQ2一様な確率的手法(精度サンプリング)を用いて、異なる問題にわたる広範なストリーミングアルゴリズムを統一的かつ簡略化できるか?
  • RQ3ノイズのある推定値から和を推定する際の、近似精度と合計コスト(すなわち$\sum 1/u_i$)の最適なトレードオフは何か?
  • RQ4この枠組みは、$F_k$-モーメントに加えて、$\ell_p$-ノルム、カスケードノルム、$\ell_p$-サンプリングに対しても拡張可能か?
  • RQ5これらの問題に対する、最もタイトな空間バウンドは何か?そして、単純な線形スケッチ手法で達成可能か?

主な発見

  • $k > 2$の$F_k$-モーメント推定において、提案された枠組みは$O(n^{1-2/k} \cdot \epsilon^{-2-4/k} \log^2 n)$の空間計算量を達成し、先行研究のバウンドを改善する。
  • $p \in [1,2]$の$\ell_p$-ノルム推定では、小さな更新時間とほぼ最適な空間計算量を達成し、一般の更新をサポートする線形スケッチを備える。
  • 同じコアアルゴリズム的構造を用いて、すべての$p,q > 0$に対してカスケードノルム$\ell_p(\ell_q)$の効率的推定が可能になる。
  • この手法は$\ell_1$-サンプリングをサポートし、自然に$\ell_p$-サンプリング($p \in [1,2]$)へ拡張可能であり、要素$i$を$|x_i| / \|x\|_1$の確率で選ぶ。
  • 精緻化された精度サンプリング補題により、$\sum a_i = \Omega(1)$のとき、合計近似コストが$O(n \log n)$に保証され、既存で最高のバウンドと一致する。
  • 下界の結果から、空間使用量がほぼ最適であり、期待される重みの合計$w_i$に対して$\Omega(n / (\rho \epsilon) \cdot \log(n/\alpha))$の下界が得られ、枠組みのタイトさが裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。