[论文解读] Near-Optimal Closeness Testing of Discrete Histogram Distributions
本文提出了一种新算法,用于在近似最优样本复杂度下测试 $[n]$ 上两个离散 $k$-直方图分布的接近性,实现了 $O(k^{4/5}/\tilde{\epsilon}^{6/5})$ 的上界,相比先前工作提升了多项式因子。同时,该工作还建立了近乎匹配的信息论下界,解决了长期存在的关于 $k$、$n$ 和 $\epsilon$ 的直方图接近性测试样本复杂度的理解差距。
We investigate the problem of testing the equivalence between two discrete histograms. A {\em $k$-histogram} over $[n]$ is a probability distribution that is piecewise constant over some set of $k$ intervals over $[n]$. Histograms have been extensively studied in computer science and statistics. Given a set of samples from two $k$-histogram distributions $p, q$ over $[n]$, we want to distinguish (with high probability) between the cases that $p = q$ and $\|p-q\|_1 \geq ε$. The main contribution of this paper is a new algorithm for this testing problem and a nearly matching information-theoretic lower bound. Specifically, the sample complexity of our algorithm matches our lower bound up to a logarithmic factor, improving on previous work by polynomial factors in the relevant parameters. Our algorithmic approach applies in a more general setting and yields improved sample upper bounds for testing closeness of other structured distributions as well.
研究动机与目标
- 填补在 $[n]$ 上两个 $k$-直方图分布之间接近性测试的样本复杂度边界差距。
- 设计一种样本复杂度几乎匹配信息论下界的算法。
- 解决样本复杂度对 $k$、$n$ 和 $\epsilon$ 之间相互作用的依赖关系。
- 扩展 [DKN15a] 的框架,以实现对结构化离散分布的更高样本效率。
- 提供一个近乎紧致的下界,以证明所提算法的最优性。
提出的方法
- 该算法利用了一种新颖的伪分布构造,并应用泊松过程来模拟对块结构分布的采样。
- 关键组成部分包括在 $[W]$ 上使用具有受控总变差距离的分布族 $\mathcal{E}$、$\mathcal{E}_0$ 和 $\mathcal{F}$。
- 通过利用块之间的条件独立性,来界定采样过程与底层分布族之间的互信息。
- 该方法采用混合分布构造:在 $k+2m$ 个大小为 $W$ 的块上,分别使用 $\mathcal{E}_0/m$、$\mathcal{E}\epsilon/k$ 和 $\mathcal{F}/m$。
- 通过尾部分析和集中不等式来界定互信息 $I(X:A)$,以证明当样本量不足时的不可区分性。
- 下界构造依赖于通过总变差距离和信息论论证来区分两组分布 $\mathcal{D}$ 和 $\mathcal{D}'$。
实验结果
研究问题
- RQ1在 $[n]$ 上测试两个 $k$-直方图分布之间接近性的最优样本复杂度是多少?
- RQ2样本复杂度如何依赖于 $k$、$n$ 和 $\epsilon$ 之间的相互作用?
- RQ3能否将 $k$-直方图接近性测试的样本复杂度改进至优于先前工作的 $O(k^{4/5}/\epsilon^{6/5})$ 上界?
- RQ4先前已知的 $\Omega(k^{2/3}/\epsilon^{4/3})$ 下界是否紧致,或可进一步改进?
- RQ5[DKN15a] 的框架能否被扩展,以对如直方图等结构化离散分布实现近乎最优的边界?
主要发现
- 所提算法实现了 $O(k^{4/5}/\epsilon^{6/5})$ 的样本复杂度,相比先前的上界 $O(k^{4/5}/\epsilon^{6/5})$ 提升了多项式因子。
- 信息论下界为 $\Omega(k^{2/3}/\epsilon^{4/3})$,几乎与上界匹配,仅相差对数因子。
- 样本复杂度与域大小 $n$ 无关,表明 $k$-直方图的结构特性可带来显著的效率提升。
- 下界通过精心构造的伪分布族和互信息论证得出,表明任何算法都无法实现优于 $\Omega(k^{2/3}/\epsilon^{4/3})$ 的样本复杂度。
- 结果表明,样本复杂度对 $k$、$n$ 和 $\epsilon$ 之间的关系具有非平凡依赖,与简单问题的直觉相反。
- 该框架可推广至其他结构化分布的接近性测试,超越直方图本身。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。