Skip to main content
QUICK REVIEW

[论文解读] Simple set cardinality estimation through random sampling

Marco Bressan, Enoch Peserico|arXiv (Cornell University)|Dec 24, 2015
Machine Learning and Algorithms参考文献 3被引用 9
一句话总结

本文提出了一种简单、黑箱的算法,通过均匀随机采样估计集合 $ V $ 的基数 $ n $。该算法保证以概率 $ 1-\delta $ 获得 $ (1\pm\epsilon) $-近似结果,所需样本数为 $ O\big{(}\sqrt{n}\cdot\epsilon^{-1}\sqrt{\log(\delta^{-1})}\big{)} $,并利用鞅集中不等式对样本复杂度进行紧致分析。

ABSTRACT

We present a simple algorithm that estimates the cardinality $n$ of a set $V$ when allowed to sample elements of $V$ uniformly and independently at random. Our algorithm with probability $(1-δ)$ returns a $(1\pmε)-$approximation of $n$ drawing $O\big(\sqrt{n} \cdot ε^{-1}\sqrt{\log(δ^{-1})}\big)$ samples (for $ε^{-1}\sqrt{\log(δ^{-1})} = O(\sqrt{n})$).

研究动机与目标

  • 设计一种实用且可分析的算法,仅通过均匀随机采样来估计集合的大小。
  • 为在高斯概率 $ 1-\delta $ 下实现 $ (1\pm\epsilon) $-近似所需样本数,提供紧致的、非渐近的边界。
  • 应用现代鞅集中不等式分析采样过程,并推导出样本复杂度保证。
  • 使该算法可作为插件原原子程序,在需要基数估计的更大规模算法中使用。

提出的方法

  • 该算法维护一个已见元素集合 $ S $,并跟踪样本总权重 $ w $ 和重复次数 $ r $。
  • 基于 $ \epsilon $ 和 $ \delta $ 设定停止阈值 $ k = \lceil \frac{2+4.4\epsilon}{\epsilon^2} \ln(3/\delta) \rceil $。
  • 当累计重复次数 $ r $ 达到 $ k $ 时,算法终止,并返回 $ \hat{n} = w/r $ 作为估计值。
  • 应用鞅尾部不等式([1] 中定理 2.2)来限制重复次数与其期望值的偏离。
  • 分析使用鞅 $ Z_i = \sum_{j=1}^i (\chi_j - P_j) $,其中 $ \chi_j $ 表示是否发生重复,$ P_j $ 为其条件概率。
  • 对低估和高估事件分别应用集中不等式,确保每种尾部事件的误差概率小于 $ \delta/3 $。

实验结果

研究问题

  • RQ1为在概率 $ 1-\delta $ 下将集合基数估计在 $ (1\pm\epsilon) $ 因子范围内,最少需要多少均匀随机样本?
  • RQ2能否使用现代集中不等式对一种简单、黑箱的基数估计算法进行严格分析?
  • RQ3样本复杂度如何随 $ \epsilon $ 和 $ \delta $ 变化?是否可独立于 $ n $ 进行有界?
  • RQ4该算法超过给定样本预算的概率是多少?如何对其进行有界?

主要发现

  • 该算法以大于 $ 1-\delta $ 的概率返回真实基数 $ n $ 的 $ (1\pm\epsilon) $-近似值。
  • 样本的期望数量被限制在 $ \min(n, 2\lceil \sqrt{kn} \rceil) + k $ 之内,其中 $ k = \lceil \frac{2+4.4\epsilon}{\epsilon^2} \ln(3/\delta) \rceil $。
  • 样本复杂度为 $ O\big{(} \sqrt{n} \cdot \epsilon^{-1} \sqrt{\log(\delta^{-1})} \big{)} $,当 $ \epsilon $ 较小时在 $ n $ 上呈次线性。
  • 低估或高估的误差概率各自被控制在 $ \delta/3 $ 以内,确保总失败概率小于 $ \delta $。
  • 分析表明,超过样本边界的概率小于 $ \delta/3 $,从而通过联合界完成对所有失败模式的覆盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。