Skip to main content
QUICK REVIEW

[論文レビュー] Sharp Bounds for Generalized Uniformity Testing

Ilias Diakonikolas, Daniel M. Kane|arXiv (Cornell University)|Sep 7, 2017
Machine Learning and Algorithms参考文献 27被引用数 5
ひとこと要約

この論文は、未知の離散確率分布がその定義域のある部分集合上で一様であるか、あるいは任意のそのような一様分布から全 Variation 距離で $\epsilon$ 以上離れているかを区別する問題である一般化された一様性検定のタイトな標本複雑度の境界を確立する。著者らは、最適な標本複雑度 $\Theta\left(1/(\epsilon^{4/3}\|p\|_{3})+1/(\epsilon^{2}\|p\|_{2})\right)$ を達成する計算的に効率的な検定器を提示し、これと一致する情報理論的下界を確立している。

ABSTRACT

We study the problem of generalized uniformity testing \cite{BC17} of a discrete probability distribution: Given samples from a probability distribution $p$ over an {\em unknown} discrete domain $\mathbfΩ$, we want to distinguish, with probability at least $2/3$, between the case that $p$ is uniform on some {\em subset} of $\mathbfΩ$ versus $ε$-far, in total variation distance, from any such uniform distribution. We establish tight bounds on the sample complexity of generalized uniformity testing. In more detail, we present a computationally efficient tester whose sample complexity is optimal, up to constant factors, and a matching information-theoretic lower bound. Specifically, we show that the sample complexity of generalized uniformity testing is $Θ\left(1/(ε^{4/3}\|p\|_3) + 1/(ε^{2} \|p\|_2) ight)$.

研究の動機と目的

  • 未知の定義域上で一様である可能性のある分布と、そのような一様分布から全 Variation 距離で $\epsilon$ 以上離れている分布を区別する問題としての一般化された一様性検定の標本複雑度を正確に同定すること。
  • 先行研究 [BC17] が提供した標本複雑度に関する緩い上界と下界のギャップを埋めること。
  • 定数要因を除いて最適な標本複雑度を達成する計算的に効率的な検定器を開発すること。
  • 提案された検定器の標本複雑度の最適性を裏付ける一致する情報理論的下界を確立すること。

提案手法

  • アルゴリズムは $\epsilon$ と $\|p\|_2^2$ の相対的な大きさに基づくケース解析を実行し、$\epsilon$ が大きい場合と小さい場合を別々に処理する。
  • $\epsilon$ が大きい場合、$p$ が一様であるとき $\|p\|_3 = \|p\|_2^{4/3}$ であるという恒等式を活用し、$\|p\|_2$ と $\|p\|_3$ の正確な推定により偏差を検出する。
  • 検定器は、標本からの経験的頻度度数に依存する、確率分布の2次および3次モーメント(衝突統計量)の不偏推定量を使用する。
  • 下界の確立にはカップリングの議論と情報理論的手法を用い、仮説と十分統計量(衝突回数)との間の相互情報量を分析する。
  • 2つの分布を構築する:1つは部分集合上で一様な分布、もう1つは任意の一様分布から $\epsilon$ 離れている分布。これにより、$\Omega(n^{2/3}/\epsilon^{4/3} + n^{1/2}/\epsilon^2)$ より少ない標本数では、いかなるアルゴリズムでもこれらを信頼性高く区別できないことを示す。
  • 解析には指数関数項のテイラー展開と、衝突回数における確率の二乗差の上限評価を含み、最終的に相互情報量が $o(1)$ であることを示し、区別不能性を示す。

実験結果

リサーチクエスチョン

  • RQ1一般化された一様性検定の正確な標本複雑度は、$\epsilon$、$\|p\|_2$、$\|p\|_3$ の関数としてどのように表されるか?
  • RQ2計算的に効率的な検定器は、この問題の最適な標本複雑度を達成できるか?
  • RQ3一般化された一様性検定の標本複雑度は、標準的な一様性検定と顕著に異なるか?
  • RQ4この問題を解くために必要な標本数の情報理論的限界は何か?

主な発見

  • 一般化された一様性検定の標本複雑度は $\Theta\left(1/(\epsilon^{4/3}\|p\|_{3})+1/(\epsilon^{2}\|p\|_{2})\right)$ であり、定数要因を除いて最適である。
  • 提案された検定器は計算的に効率的であり、期待的に $O\left(1/(\epsilon^{4/3}\|p\|_{3})+1/(\epsilon^{2}\|p\|_{2})\right)$ の標本数を用いる。
  • 一致する情報理論的下界 $\Omega(n^{2/3}/\epsilon^{4/3} + n^{1/2}/\epsilon^2)$ が確立され、ここで $\|p\|_3 = \Theta(n^{-2/3})$ かつ $\|p\|_2 = \Theta(n^{-1/2})$ である。
  • 下界は、1つは部分集合上で一様な分布、もう1つは任意の一様分布から $\epsilon$ 離れている分布である2つの分布を構築することで証明され、相互情報量が $o(1)$ であることを示している。
  • 解析により、$t=1$、$t=2$、$t>2$ の各場合において、全 Variation 距離への寄与が $o(1/N)$ であることが示され、より少ない標本数では2つの仮説を信頼性高く区別できないことが示される。
  • 結果は、一般化された一様性検定が、標準的一様性検定とは本質的に異なる標本複雑度を持つことを確認しており、後者の標本複雑度は $\Theta(n^{1/2}/\epsilon^2)$ である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。