Skip to main content
QUICK REVIEW

[論文レビュー] A Space-Efficient Dynamic Dictionary for Multisets with Constant Time Operations

Ioana O. Bercea, Guy Even|arXiv (Cornell University)|May 5, 2020
Caching and Content Delivery参考文献 27被引用数 4
ひとこと要約

本稿では、Arbitmanら(2010年)が提起した未解決問題を解決し、最悪計算量で一定時間、高確率で動作する空間効率的な動的マルチセット辞書を初めて提示する。この手法は、対象となる変動長2進カウンタを効率的に格納するため、対数的重みをもつボール-イン-ビン実験を用いた新規技術を導入している。

ABSTRACT

We consider the dynamic dictionary problem for multisets. Given an upper bound $n$ on the total cardinality of the multiset (i.e., including multiplicities) at any point in time, the goal is to design a data structure that supports multiplicity queries and allows insertions and deletions to the multiset (i.e., the dynamic setting). The data structure must be space-efficient (the space is $1+o(1)$ times the information-theoretic lower bound) and support all operations in constant time with high probability. In this paper, we present the first dynamic dictionary for multisets that achieves these performance guarantees. This answers an open problem of Arbitman, Naor and Segev (FOCS 2010). The previously best-known construction of Pagh, Pagh and Rao (SODA 2005) supports membership in constant time, multiplicity queries in $O(\log n)$ time in the worst case, and insertions and deletions in constant expected amortized time. The main technical component of our solution is a strategy for efficiently storing variable-length binary counters using weighted balls-into-bins experiments in which balls have logarithmic weights. We also obtain a counting filter that approximates multiplicity queries with a one sided error, using the reduction of Carter et al. (STOC 1978). Counting filters have received significant attention over the years due to their applicability in practice.We present the first counting filter with constant time operations.

研究の動機と目的

  • 空間効率的で、すべての操作(挿入、削除、重複度照会)を最悪計算量で一定時間、高確率で実行できる動的マルチセット辞書の設計。
  • Arbitman, Naor, Segev(2010年)が提起した未解決問題、すなわち、定数時間で動作する動的マルチセット辞書が最適な空間使用量を達成できるかどうかを解明すること。
  • 従来の$O(\log n)$の重複度照会時間に比べ、均し計算時間や期待時間から最悪計算量で一定時間、高確率での動作にまで向上させること。
  • 核心部品としてマルチセット辞書を用い、定数時間の操作と片側エラーを有するカウンティングフィルタを構築すること。
  • マルチセットの情報理論的下界$ n\log(u/n) + \Theta(n) $ビットの$1+o(1)$倍の空間使用量を達成すること。

提案手法

  • 変動長2進カウンタを効率的に表現するため、ボールに対数的重みをもたせた重み付きボール-イン-ビンモデルを活用する。
  • $k$-wise $\delta$-依存順列を用いて、ユニバースを$M$個の部分に分割し、高確率で負荷分散を確保する。
  • $k'$-wise独立ハッシュ関数に基づく擬似ランダムな分割方式を採用し、要素を部分にマッピングしながら負荷のバランスを維持する。
  • $k'$-wise独立な確率変数に対するチェルノフの不等式を適用し、各部分のマルチセットの基数が高確率で$ n^{1/10} + n^{3/40}\log^{3/2}n $以下であることを証明する。
  • 重複度が$ \log^3 n $以上である要素のための余剰ストレージを導入し、操作を一定時間で維持する。
  • 要素をフィンガープリントにペアワイズ独立ハッシュすることで、カウンティングフィルタ問題をマルチセット辞書問題に還元し、片側エラーを有する定数時間の近似重複度照会を可能にする。

実験結果

リサーチクエスチョン

  • RQ1最悪計算量で一定時間、高確率で動作する空間効率的な動的マルチセット辞書を構築することは可能か?
  • RQ2最適な空間使用量(情報理論的下界の$1+o(1)$倍)を達成しながら、定数時間の操作を維持することは可能か?
  • RQ3Arbitmanら(2010年)の集合に対する手法を、任意の重複度をもつマルチセットに拡張することは可能か?
  • RQ4擬似ランダムな分割方式下で、各部分のマルチセットの最大基数は何か?また、高確率でその上限を示せるか?
  • RQ5動的マルチセット辞書を構築ブロックとして用い、定数時間の操作と片側エラーを有するカウンティングフィルタを構築することは可能か?

主な発見

  • 提案された動的マルチセット辞書は、すべての操作(挿入、削除、重複度照会)を最悪計算量で一定時間、高確率で実行可能である。
  • 空間使用量は、情報理論的下界$ n\log(u/n) + \Theta(n) $ビットの$1+o(1)$倍であり、最適な空間効率性を達成している。
  • 分割後の各マルチセット部分の基数は、高確率で$ n^{1/10} + n^{3/40}\log^{3/2}n $以下に抑えられており、負荷分散が保証されている。
  • 変動長カウンタを効率的に格納するため、対数的重みをもつボール-イン-ビンモデルを用いた新規技術を導入している。
  • 空間使用量が$ O(n\log(1/\varepsilon)) $ビットのカウンティングフィルタが、片側エラーが$ \varepsilon $以下であることを保証しながら、定数時間の操作を実現している。
  • 本研究は、Arbitman, Naor, Segev(2010年)が提起した未解決問題を解決し、最適な空間使用量と最悪計算量で一定時間の両方を満たす初の動的マルチセット辞書を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。