Skip to main content
QUICK REVIEW

[论文解读] On the Convergence of the Empirical Distribution

Daniel Berend, Aryeh Kontorovich|arXiv (Cornell University)|May 30, 2012
Probability and Risk Models参考文献 7被引用 9
一句话总结

本文针对可数无限支撑上经验分布与真实分布之间的总变差距离,利用McDiarmid不等式和对期望$\varepsilon$-偏差的精细分析,推导出紧致的集中不等式。该工作在Devroye有限支撑界的基础上,通过收紧指数中的常数,实现了改进,并建立了适用于可数支撑分布的非渐近尾部界限,同时通过下界分析表明该收敛速率无法在所有分布上实现统一的改进。

ABSTRACT

We develop a general technique for bounding the tail of the total variation distance between the empirical and the true distributions over countable sets. Our methods sharpen a deviation bound of Devroye (1983) for distributions over finite sets, and also hold for the broader class of distributions with countable support. We also provide some lower bounds of possible independent interest.

研究动机与目标

  • 建立当支撑为可数无限时,经验分布与真实分布之间总变差距离的非渐近尾部界限。
  • 将Devroye对有限支撑分布的偏差界进行精细化和拓展,推广至更广泛的可数支撑分布类别。
  • 为经验分布与真实分布之间的$\ell_1$-距离提供显式且可解析处理的集中不等式。
  • 推导非渐近下界以证明所导出界限的最优性。

提出的方法

  • 将McDiarmid不等式应用于经验频率与其期望之间$\ell_1$-偏差函数,将其视为汉明距离下的2-Lipschitz函数。
  • 通过将分布分解为高概率和低概率原子,结合二项尾部估计,对期望$\ell_1$-偏差$\mathbb{E}[J_n]$进行上界控制。
  • 采用两段式分析:$\alpha_n(\boldsymbol{p})$用于概率低于$1/n$的部分,$\beta_n(\boldsymbol{p})$用于高于$1/n$的部分,以控制期望偏差。
  • 通过构造一个偏差衰减可任意缓慢的分布,建立$\mathbb{E}[J_n]$的下界,证明该收敛速率无法在所有分布上统一改进。
  • 利用已知的二项分布均绝对偏差结果,并结合渐近分析,推导出期望偏差的紧致上界。
  • 将McDiarmid不等式与期望偏差界结合,导出形式为$P(J_n > \varepsilon) \leq \exp\left(-\frac{n}{2}(\varepsilon - \sqrt{k/n})^2\right)$的尾部界限,其中$k$为有限支撑大小。

实验结果

研究问题

  • RQ1Devroye对$\ell_1$-距离在有限支撑下的集中界,能否推广至可数无限支撑的分布?
  • RQ2当支撑为可数时,$\ell_1$-距离尾部界限中指数部分的最优常数是多少?
  • RQ3对于无限支撑的分布,期望$\ell_1$-偏差的衰减速率有多快?该速率能否在所有此类分布上实现统一有界?
  • RQ4是否存在某些分布,使得经验分布向真实分布的$\ell_1$收敛速率可任意缓慢?若存在,如何形式化描述?

主要发现

  • 本文建立了新的$\ell_1$-距离尾部界限:对于支撑大小为$k$的分布,有$P(J_n > \varepsilon) \leq \exp\left(-\frac{n}{2}(\varepsilon - \sqrt{k/n})^2\right)$,相比Devroye的界,通过收紧指数中的常数实现了改进。
  • 对于可数无限支撑的分布,本文推导出对所有此类分布统一成立的集中界限,其中期望偏差$\mathbb{E}[J_n]$通过高概率与低概率原子的分解实现有界控制。
  • 本文证明了$\ell_1$收敛速率无法统一改进:对任意趋于零的速率序列$r_n \searrow 0$,均存在一个分布,使得偏差超过$r_n$的次数无限次,表明该速率在非统一意义下是最优的。
  • 推导出期望$\ell_1$-偏差的下界,表明在特定条件下有$\mathbb{E}[J_n] \geq \Omega(\sqrt{\alpha_n(\boldsymbol{p})/n})$,从而证明了上界的紧致性。
  • 分析表明,通过Borel-Cantelli引理与所推导界限,即使在无限支撑下,经验分布向真实分布的$\ell_1$-收敛也几乎必然成立。
  • 该界限被证明近乎最优,因为由[1, 定理1]的精神可推导出指数部分的匹配下界,从而确认了集中速率的紧致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。