Skip to main content
QUICK REVIEW

[論文レビュー] A short note on learning discrete distributions

Clément L. Canonne|arXiv (Cornell University)|Feb 25, 2020
Machine Learning and Algorithms参考文献 4被引用数 7
ひとこと要約

本ノートでは、既知のドメインサイズ $k$ の離散確率分布を、全変動距離、ヘリンジャー距離、$χ^2$ 距離、カルバック・ライブララー距離、および $ι_{\infty}$, $\ell_2$, コルモゴロフ距離といったさまざまな距離測度の下で学習する際のサンプル複雑性について、簡潔で自己完結的な証明を提供する。タイトな境界を確立し、全変動距離およびヘリンジャー距離の下ではサンプル複雑性が $\Theta\left(\frac{k + \log(1/\delta)}{\varepsilon^2}\right)$ であるのに対し、コルモゴロフ、$\ell_\infty$、$\ell_2$ の下では $\Theta\left(\frac{\log(1\!\!\,/\!\!\delta)}{\varepsilon^2}\right)$ であり、$k$ とは無関係であることを示した。すべてのケースにおいて、経験的分布推定器が最適な性能を達成する。

ABSTRACT

The goal of this short note is to provide simple proofs for the "folklore facts" on the sample complexity of learning a discrete probability distribution over a known domain of size $k$ to various distances $\varepsilon$, with error probability $δ$.

研究の動機と目的

  • 分布学習におけるよく知られたがしばしば前提とされるサンプル複雑性境界の、簡単でアクセスしやすい証明を提供すること。
  • 全変動距離、ヘリンジャー距離、$\\chi^2$、KL発散、$\ell_p$ 型距離といった複数の距離測度の下での離散分布学習のサンプル複雑性を統一的かつ明確にすること。
  • 各距離測度について、明示的な $k$、$\varepsilon$、$\delta$ 依存性を伴うタイトな漸近的境界を確立すること。
  • すべての考察された距離測度において、経験的分布推定器が最適なサンプル複雑性を達成することを示すこと。
  • $\chi^2$ 距離に関する未解決の問い題を解決し、最適境界が未だ不明であることを示しながら、他の測度についてはタイトさが確認されることを示すこと。

提案手法

  • 真の分布 $p$ からの独立同一分布に従うサンプルのカウントを正規化して定義される経験的分布推定器 $\tilde{p}$ を、学習の中心的メカニズムとして用いる。
  • ジェンセンの不等式およびコーシー=シュワルツの不等式を用いて、$p$ と $\tilde{p}$ 間の期待 $\ell_1$-距離(全変動距離)を抑え、$\mathbb{E}[\operatorname{d}_{\rm TV}(p,\tilde{p})] \leq \frac{1}{2}\sqrt{k/n}$ を得る。
  • マクディアーミッドの不等式を用いて、期待誤差からの高確率集中を導出し、$n = \Omega(\log(1/\delta)/\varepsilon^2)$ が高信頼度での学習に十分であることを示す。
  • すべての $2^k$ 個の部分集合 $S \subseteq [k]$ における和集合を用いた和集合不等式を用い、ベルヌーイ和のホエーディングの不等式を適用して、$\tilde{p}(S) > p(S) + \varepsilon$ となる確率を抑えている。
  • DKW不等式(マッサール定数を含む)を用いて、連続分布に対しても有効なコルモゴロフ距離の高確率境界を確立する。
  • ノルム不等式および $\ell_p$ ノルムの単調性を用いて、異なる距離測度を関連付け、比較によるサンプル複雑性境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1全変動距離の下で、ドメインサイズ $k$ の離散分布を学習する際の最適なサンプル複雑性は何か?
  • RQ2ヘリンジャー距離におけるサンプル複雑性は、全変動距離におけるものと比べてどう異なるか?
  • RQ3カルバック・ライブララー発散の下でのサンプル複雑性は何か?また、経験的推定器はそれを達成するか?
  • RQ4コルモゴロフ、$\ell_\infty$、$\ell_2$ 距離におけるサンプル複雑性がなぜ $k$ に依存しないのか?
  • RQ5$\chi^2$ 距離のサンプル複雑性は既知か?もし未知であれば、なぜ未解決のままであるのか?

主な発見

  • 全変動距離におけるサンプル複雑性は $\Phi(\operatorname{d}_{\rm TV},k,\varepsilon,\delta) = \Theta\left(\frac{k + \log(1/\delta)}{\varepsilon^2}\right)$ であり、経験的推定器がこの境界に達している。
  • ヘリンジャー距離においてもサンプル複雑性は $\Theta\left(\frac{k + \log(1/\delta)}{\varepsilon^2}\right)$ であり、ノルム不等式と集中不等式の組み合わせによって証明されている。
  • コルモゴロフ、$\ell_\infty$、$\ell_2$ 距離におけるサンプル複雑性は $\Theta\left(\frac{\log(1/\delta)}{\varepsilon^2}\right)$ であり、$k$ とは無関係である。これはDKW不等式とノルム比較による。
  • カルバック・ライブララー発散のサンプル複雑性は $\Theta\left(\frac{k + \log(1/\delta)}{\varepsilon}\right)$ であり、$\ell_1$-ベースの距離とは異なり、$\varepsilon^{-2}$ スケーリングよりも厳密に優れている。
  • $\chi^2$ 距離のサンプル複雑性は未解決の問題のままであり、一方で他のすべての距離測度において経験的推定器が最適であることは既知である。
  • すべての考察された距離測度において、経験的分布推定器が最適であり、集中不等式およびノルム不等式を用いてタイトな境界が証明されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。