Skip to main content
QUICK REVIEW

[論文レビュー] Optimal lower bounds for universal relation, samplers, and finding duplicates

Jelani Nelson, Jakub Pachocki|arXiv (Cornell University)|Mar 23, 2017
Cryptography and Data Security参考文献 22被引用数 4
ひとこと要約

この論文は、公開コインプロトコル下で、普遍関係問題(UR)およびその一般化である UR_k の、確率的1方向通信複雑度の最適な下界を確立し、t = max{k, log(1/δ)} とすると、それが Θ(min{n, t log²(n/t)}) ビットであることを示している。主な技術的貢献は、仮想の低メモリアルゴリズムに対する適応的クエリを用いた新しい符号化方式であり、ランダムノイズを注入することで微分プライバシーに類似した保証を実現し、任意のこのようなアルゴリズムが情報理論的限界以下の集合の圧縮が不可能であることを示している。これにより、ストリームにおける ℓ₀-サンプリングおよび重複検出のタイトな下界が得られる。

ABSTRACT

In the communication problem $\mathbf{UR}$ (universal relation) [KRW95], Alice and Bob respectively receive $x$ and $y$ in $\{0,1\}^n$ with the promise that $x eq y$. The last player to receive a message must output an index $i$ such that $x_i eq y_i$. We prove that the randomized one-way communication complexity of this problem in the public coin model is exactly $Θ(\min\{n, \log(1/δ)\log^2(\frac{n}{\log(1/δ)})\})$ bits for failure probability $δ$. Our lower bound holds even if promised $\mathop{support}(y)\subset \mathop{support}(x)$. As a corollary, we obtain optimal lower bounds for $\ell_p$-sampling in strict turnstile streams for $0\le p < 2$, as well as for the problem of finding duplicates in a stream. Our lower bounds do not need to use large weights, and hold even if it is promised that $x\in\{0,1\}^n$ at all points in the stream. Our lower bound demonstrates that any algorithm $\mathcal{A}$ solving sampling problems in turnstile streams in low memory can be used to encode subsets of $[n]$ of certain sizes into a number of bits below the information theoretic minimum. Our encoder makes adaptive queries to $\mathcal{A}$ throughout its execution, but done carefully so as to not violate correctness. This is accomplished by injecting random noise into the encoder's interactions with $\mathcal{A}$, which is loosely motivated by techniques in differential privacy. Our correctness analysis involves understanding the ability of $\mathcal{A}$ to correctly answer adaptive queries which have positive but bounded mutual information with $\mathcal{A}$'s internal randomness, and may be of independent interest in the newly emerging area of adaptive data analysis with a theoretical computer science lens.

研究の動機と目的

  • 普遍関係問題(UR)およびその一般化である UR_k の、確率的1方向通信複雑度の最適な下界を確立すること。
  • ストレートターンstileストリームにおける ℓ₀-サンプリングまたは重複検出を解く任意のアルゴリズムが、Ω(log(1/δ) log²n) ビットのメモリを必要とすることを証明し、既知の上界と一致させること。
  • 低メモリアルゴリズムを変換して、情報理論的限界を下回る圧縮を実現する新しい符号化方式を開発し、矛盾による下界の証明を行うこと。
  • 有界相互情報量を持つランダム化アルゴリズムに対する適応的クエリの正しさを分析し、適応的データ解析の理論に貢献すること。

提案手法

  • Alice と Bob が x と y が異なる添え字のうち最小で k 個の異なる添え字を出力する通信問題 UR_k を提案する。
  • 仮想の低メモリアルゴリズム A を適応的にクエリし、情報理論的限界より少ないビット数で部分集合 S ⊆ [n] を圧縮する符号化方式(ENC_k)を設計する。
  • クエリと A の内部状態の相互情報量を制限するために、A とのインタラクションにランダムノイズを注入し、微分プライバシーに類似した性質を再現する。
  • 宇宙 [n] を R = Θ(log(n/k)) レベルに再帰的に分割し、各レベルで要素の半分をランダムに保持することで、識別可能な部分集合の数を増幅する。
  • 同じアルゴリズム A を、元の集合 S を復元できるように注意深く構成された入力に対して適用することで、元の集合 S を復元するデコーダー(DEC_k)を構築する。
  • チェルノフの不等式を用いて、確率一定以上で最終的な集合 S_R のサイズが ≥ k であることを示し、k 個の異なる異なる添え字を回復するプロトコルの成功を保証する。

実験結果

リサーチクエスチョン

  • RQ1失敗確率 δ における普遍関係問題 UR の最適な確率的1方向通信複雑度は何か?
  • RQ2k 個の異なる異なる添え字を特定する必要がある一般化された UR_k 問題では、複雑度はどのようにスケーリングされるか?
  • RQ3UR_k における通信複雑度の下界から、データストリームにおける ℓ₀-サンプリングおよび重複検出のタイトな下界を導けるか?
  • RQ4低メモリアルゴリズムに対する適応的クエリメカニズムを用いて、情報理論的圧縮限界を破る圧縮が可能となり、その結果としてメモリ下界が証明できるか?
  • RQ5ノイズ注入下で、適応的クエリとアルゴリズム状態の間の相互情報量が、正しさを維持するために果たす役割は何か?

主な発見

  • 失敗確率 δ における普遍関係問題 UR の確率的1方向通信複雑度は、Θ(min{n, log(1/δ) log²(n/log(1/δ))}) ビットである。
  • 一般化された UR_k 問題では、最適な複雑度は Θ(min{n, t log²(n/t)}) ビットであり、t = max{k, log(1/δ)} である。
  • ストレートターンstileモデルにおける ℓ₀-サンプリングに対して、初めて Ω(log(1/δ) log²n) ビットの空間下界が確立された。この下界は δ > 2^{-n^{0.99}} の範囲で有効である。
  • 入力ベクトルがストリーム全体で {0,1}^n に制限されている場合でも、下界は成り立つ。これは、大きな重みを必要としない。
  • 適応的クエリとノイズ注入を活用することで、符号化方式は情報理論的最小値を下回る圧縮を実現し、k 要素の回復に Ω(k log²(n/k)) ビットのメモリが必要であることを証明した。
  • 有界相互情報量を持つ適応的クエリの分析は、理論的コンピュータサイエンスの応用を想定した、適応的データ解析の新しいツールを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。