QUICK REVIEW
[論文レビュー] On the Convergence of the Empirical Distribution
Daniel Berend, Aryeh Kontorovich|arXiv (Cornell University)|May 30, 2012
Probability and Risk Models参考文献 7被引用数 9
ひとこと要約
本稿は、可算無限のサポートを持つ分布の経験的分布と真の分布の間の全 Variation 距離について、McDiarmidの不等式と期待 $\varepsilon$-偏差の精密分析を用いて鋭い集中不等式を導出する。Devroyeの有限サポートに対する境界を、指数の定数を厳しくすることで改善し、可算サポートを持つ分布に対しても有効な非漸近的尾部不等式を確立する。また、そのレートが一様に改善できないことを示す下界も提示する。
ABSTRACT
We develop a general technique for bounding the tail of the total variation distance between the empirical and the true distributions over countable sets. Our methods sharpen a deviation bound of Devroye (1983) for distributions over finite sets, and also hold for the broader class of distributions with countable support. We also provide some lower bounds of possible independent interest.
研究の動機と目的
- サポートが可算無限である場合に、経験的分布と真の分布の間の全 Variation 距離に対する非漸近的尾部不等式を確立すること。
- 有限サポート分布に対するDevroyeの偏差境界を、より広い可算サポートを持つ分布のクラスへと精緻化・拡張すること。
- 経験的分布と真の分布の $\ell_1$-距離に対する明示的かつ解析的に取り扱いやすい集中不等式を提供すること。
- 収束レートに対する非漸近的下界を導出し、導出された境界の最適性を示すこと。
提案手法
- 経験的頻度とその期待値との $\ell_1$-偏差関数にMcDiarmidの不等式を適用し、ハミング距離下で2-Lipschitz関数とみなす。
- 二項分布の尾部推定を用いて、分布を高確率・低確率の原子に分解することで、期待 $\ell_1$-偏差 $\mathbb{E}[J_n]$ を評価する。
- 期待偏差を制御するための二段階分析を採用:$\alpha_n(\boldsymbol{p})$ は $1/n$ 未満の確率、$\beta_n(\boldsymbol{p})$ は $1/n$ 以上の確率を対象とする。
- 偏差が任意にゆっくり減衰する分布を構成することで、$\mathbb{E}[J_n]$ の下界を確立し、そのレートが一様に改善できないことを示す。
- 既知の二項分布平均絶対偏差に関する結果を活用し、漸近的解析を適用して期待偏差のタイトな境界を導出する。
- McDiarmidの不等式と期待偏差の境界を組み合わせ、有限 $k$ に対して $P(J_n > \varepsilon) \leq \exp\left(-\frac{n}{2}(\varepsilon - \sqrt{k/n})^2\right)$ の形の尾部不等式を導出する。
実験結果
リサーチクエスチョン
- RQ1Devroyeの有限サポートに対する経験的分布と真の分布の $\ell_1$-距離の集中境界を、可算無限サポートを持つ分布へと拡張できるか?
- RQ2サポートが可算である場合に、$\ell_1$-距離の尾部不等式における指数の最適定数は何か?
- RQ3無限サポートを持つ分布に対して、期待 $\ell_1$-偏差はどの程度速く減衰できるか? また、そのレートはすべてのこのような分布に対して一様に束縛可能か?
- RQ4経験的分布が真の分布へ $\ell_1$ で収束するレートが、任意に遅い分布は存在するか? もしそうなら、その性質をどのように形式化できるか?
主な発見
- 本稿は、$\ell_1$-距離に対する新たな尾部不等式を確立した:分布のサポートサイズが $k$ の場合、$P(J_n > \varepsilon) \leq \exp\left(-\frac{n}{2}(\varepsilon - \sqrt{k/n})^2\right)$ が成り立ち、Devroyeの境界を指数の定数を厳しくすることで改善した。
- 可算無限サポートを持つ分布に対しては、すべてのこのような分布に一様に成立する集中不等式を導出し、期待偏差 $\mathbb{E}[J_n]$ を高確率・低確率の原子への分解により評価した。
- 本稿は、$\ell_1$ 収束レートを一様に改善できないことを証明した:任意の減少列 $r_n \searrow 0$ に対して、偏差が無限回にわたって $r_n$ を上回るような分布が存在し、その結果、レートは非一様な意味で最適であることが示された。
- 期待 $\ell_1$-偏差に対する下界を導出し、特定の条件下で $\mathbb{E}[J_n] \geq \Omega(\sqrt{\alpha_n(\boldsymbol{p})/n})$ が成り立つことを示した。これにより、上界のタイトさが裏付けられた。
- Borel-Cantelliの補題と導出された境界を組み合わせることで、無限サポートに対しても、経験的分布の真の分布への $\ell_1$ 収束がほとんど確実に完全であることが確認された。
- 境界が近似的に最適であることが示された。一般に [1, Theorem 1] の精神に則った一般的な議論により、指数部に一致する下界が示唆され、集中レートのタイトさが裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。