Skip to main content
QUICK REVIEW

[論文レビュー] BPTree: an $\ell_2$ heavy hitters algorithm using constant memory

Vladimir Braverman, Stephen R. Chestnut|arXiv (Cornell University)|Mar 2, 2016
Algorithms and Data Compression参考文献 30被引用数 10
ひとこと要約

本稿では、挿入のみのストリームにおけるℓ₂ハイ・ヘヴィーヘイダーのための、初めてのε⁻² log ε⁻¹の空間、O(log ε⁻¹)の更新時間を持つアルゴリズム、BPTreeを提案する。これはnやmに依存しない最適な空間および時間計算量を達成する。本手法は、圧縮センシングにインspiredされたフィルタリング機構のデランドマイズに、限られた独立性を持つラダマッハ過程を用いた新規なチェインジング・アーギュメントを用いる。

ABSTRACT

The task of finding heavy hitters is one of the best known and well studied problems in the area of data streams. One is given a list $i_1,i_2,\ldots,i_m\in[n]$ and the goal is to identify the items among $[n]$ that appear frequently in the list. In sub-polynomial space, the strongest guarantee available is the $\ell_2$ guarantee, which requires finding all items that occur at least $ε\|f\|_2$ times in the stream, where the vector $f\in\mathbb{R}^n$ is the count histogram of the stream with $i$th coordinate equal to the number of times~$i$ appears $f_i:=\#\{j\in[m]:i_j=i\}$. The first algorithm to achieve the $\ell_2$ guarantee was the CountSketch of [CCF04], which requires $O(ε^{-2}\log n)$ words of memory and $O(\log n)$ update time and is known to be space-optimal if the stream allows for deletions. The recent work of [BCIW16] gave an improved algorithm for insertion-only streams, using only $O(ε^{-2}\logε^{-1}\log\log n)$ words of memory. In this work, we give an algorithm \bptree for $\ell_2$ heavy hitters in insertion-only streams that achieves $O(ε^{-2}\logε^{-1})$ words of memory and $O(\logε^{-1})$ update time, which is the optimal dependence on $n$ and $m$. In addition, we describe an algorithm for tracking $\|f\|_2$ at all times with $O(ε^{-2})$ memory and update time. Our analyses rely on bounding the expected supremum of a Bernoulli process involving Rademachers with limited independence, which we accomplish via a Dudley-like chaining argument that may have applications elsewhere.

研究の動機と目的

  • 挿入のみのストリームにおけるℓ₂ハイ・ヘヴィーヘイダーの空間計算量のギャップを埋めること。従来のアルゴリズムはO(ε⁻² log n)またはO(ε⁻² log ε⁻¹ log log n)の空間を要していた。
  • 定数εに対して、Ω(ε⁻²)の空間とO(1)の更新時間という自明な下界に一致する最適な空間および時間計算量を達成すること。
  • 限られた独立性を持つラダマッハ変数を用いた、ベルヌーイ過程のための新しいデランドマイズ技術を開発すること。これはハイ・ヘヴィーヘイダーを越えて応用可能である。
  • 一回のパスで動作する、適応的フィルタリング方式を提供することで、ℓ₂ハイ・ヘヴィーヘイダーの実用的導入を可能にすること。これにより、必要なハッシュ関数の数と中央値計算の回数を削減できる。
  • O(ε⁻²)のメモリと更新時間で、常に‖f‖₂を追跡するための新規な手法を提供すること。これはモーメント推定のための主要なプリミティブである。

提案手法

  • BPTreeを提案する。これは、nやmに依存しないO(ε⁻² log ε⁻¹)ワードのメモリを用いて、スケッチの階層的ツリーを維持するデータ構造である。
  • 複数ラウンドの適応的フィルタリング処理を採用する。アイテムは推定周波数に基づいて段階的に除外され、真のハイ・ヘヴィーヘイダーがより顕著になる。
  • 4次独立なハッシュ関数を用いた新規なチェインジング・アーギュメントにより、ラダマッハ過程の期待値の上界を制御し、デランドマイズを可能にする。
  • 圧縮センシングにインspiredされた方式の1パス実装を導入する。これにより、ストリームの進行に応じてフィルタリングの閾値を動的に調整できる。
  • 非ハイ・ヘヴィーヘイダーをフィルタリングした後、真のハイ・ヘヴィーヘイダーの残存周波数が増加するという事実を活用し、検出精度を向上させる。
  • BPTreeと同一のコア技術を用いて、O(ε⁻²)のメモリとO(log ε⁻¹)の更新時間で、常に‖f‖₂を追跡するモジュールを設計する。

実験結果

リサーチクエスチョン

  • RQ1挿入のみのストリームにおけるℓ₂ハイ・ヘヴィーヘイダーの空間計算量を、nに依存しないO(ε⁻² log ε⁻¹)ワードにまで低減できるか?
  • RQ21回の更新あたり定数メモリで、O(log ε⁻¹)の更新時間とℓ₂の保証の正しさを維持できるか?
  • RQ3限られた独立性を持つラダマッハ変数を用いたチェインジング・アーギュメントは、ストリーミングアルゴリズムにおけるベルヌーイ過程のデランドマイズに用いられるか?
  • RQ4適応的フィルタリングは、CountSketchと比較して、ハッシュ関数の評価回数と中央値計算の回数を顕著に削減するか?
  • RQ51つのデータ構造が、最適な空間および時間でℓ₂ハイ・ヘヴィーヘイダーとリアルタイムの‖f‖₂追跡の両方を効率的にサポートできるか?

主な発見

  • BPTreeは、ℓ₂ハイ・ヘヴィーヘイダーに対してO(ε⁻² log ε⁻¹)の空間とO(log ε⁻¹)の更新時間を達成し、定数要因の範囲で理論的下界と一致する。
  • アルゴリズムは、常に‖f‖₂をO(ε⁻²)のメモリで追跡でき、O(log ε⁻¹)の更新時間で行える。これは従来の手法を改善する。
  • 実験では、BPTreeは特に頻度が高いハイ・ヘヴィーヘイダー(例:K ≥ 32のK-ハイ・ヘヴィーヘイダー)の状況で、CountSketchを速度とメモリ使用量の両面で上回る。
  • ハッシュ関数に4次独立性を用いることで正しさが保証され、必要なランダムビット数が削減され、効率性が向上する。
  • BPTreeの適応的フィルタリング機構により、ストリームの進行に従い、アクティブなハッシュ関数の数が減少し、更新が速くなる。
  • 限られた独立性を用いたチェインジング・アーギュメントは、ベルヌーイ過程の上界を制御する一般的手法を提供し、ハイ・ヘヴィーヘイダーを越えて応用可能である可能性を秘めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。