Skip to main content
QUICK REVIEW

[論文レビュー] Unified Sample-Optimal Property Estimation in Near-Linear Time

Hao Yi, Alon Orlitsky|arXiv (Cornell University)|Nov 8, 2019
Machine Learning and Algorithms被引用数 4
ひとこと要約

本稿では、広範なクラスの対称および非対称加法的分布的性質のための、初めてのサンプル効率的かつ時間効率的な推定器を実現する統一的で区分的多項式近似手法を提案する。この手法は漸近的に最適なサンプル複雑度を達成し、近線形の計算時間を持つ。これにより、5つの主要な性質について最適なバイアスと近似的に最適な分散を持つ推定器が得られ、ドメインサイズや信頼水準にわたる統一的で微分プライベートな推定器が実現される。

ABSTRACT

We consider the fundamental learning problem of estimating properties of distributions over large domains. Using a novel piecewise-polynomial approximation technique, we derive the first unified methodology for constructing sample- and time-efficient estimators for all sufficiently smooth, symmetric and non-symmetric, additive properties. This technique yields near-linear-time computable estimators whose approximation values are asymptotically optimal and highly-concentrated, resulting in the first: 1) estimators achieving the $\mathcal{O}(k/(\varepsilon^2\log k))$ min-max $\varepsilon$-error sample complexity for all $k$-symbol Lipschitz properties; 2) unified near-optimal differentially private estimators for a variety of properties; 3) unified estimator achieving optimal bias and near-optimal variance for five important properties; 4) near-optimal sample-complexity estimators for several important symmetric properties over both domain sizes and confidence levels. In addition, we establish a McDiarmid's inequality under Poisson sampling, which is of independent interest.

研究の動機と目的

  • 大規模ドメインにおける広範な加法的分布的性質の推定のための、統一的でサンプルおよび時間効率的な手法の開発。
  • すべての $k$-シンボルリプシッツ性質に対して漸近的に最適なサンプル複雑度を達成し、$\mathcal{O}(k/(varepsilon^{2}\log k))$ の誤差を実現する。
  • さまざまな性質に対して最適なサンプル複雑度を持つ微分プライベート推定器の統一。
  • シャノンエントロピーおよびサポートサイズを含む5つの重要な性質について、最適なバイアスと近似的に最適な分散を持つ推定器の構築。
  • ドメインサイズや信頼水準の変化にわたる対称的性質の近似的に最適なサンプル複雑度の確立。

提案手法

  • 加法的分布的性質のモデル化と推定に、新規の区分的多項式近似技術を用いることで、サンプルおよび時間の両面での効率性を実現する。
  • ポアソン標本抽出の下でのMcDiarmidの不等式の新規な変種を活用し、推定器の出力の高い集中性を保証する。
  • 関数の滑らかさとリプシッツ性を反映するように、区分的多項式で性質関数を近似することで推定器を構築する。
  • 各 $p_i$-依存成分を局所的多項式フィッティングにより処理することで、対称的および非対称的加法的性質を一様に取り扱う。
  • 周波数カウントを集約し、実現周波数に区分的多項式近似を適用することで、最終的な推定器を近線形時間で計算する。
  • 周波数カウントにキャリブレートされたノイズを追加することで微分プライバシーを達成し、プライバシーを保持しながらも精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1一様な単一の手法が、十分に滑らかで、対称的および非対称的な加法的分布的性質の両方についてサンプル最適性を達成できるか?
  • RQ2任意の $k$-シンボルリプシッツ性質を $\varepsilon$-誤差と信頼度 $2/3$ で推定するために必要な最小のサンプル複雑度は何か?
  • RQ3複数の性質にわたる最適なサンプル複雑度を持つ微分プライベート推定器を統一できるか?
  • RQ4エントロピーおよびサポートサイズのような主要な分布について、性質推定におけるバイアスと分散の最適なトレードオフは何か?
  • RQ5対称的性質について、ドメインサイズ $k$ および信頼水準 $1-\delta$ に応じてサンプル複雑度はどのようにスケーリングするか?

主な発見

  • 本稿では、すべての $k$-シンボルリプシッツ性質について、$\mathcal{O}(k/(varepsilon^{2}\log k))$ のミニマックス $\varepsilon$-誤差サンプル複雑度が初めて確立され、漸近的に最適性が達成された。
  • 微分プライベート推定器が $\mathcal{O}(k/(varepsilon^{2}\log k))$ のサンプル複雑度で構築され、非プライベートな最適境界と一致する。
  • シャノンエントロピー、サポートサイズ、サポートカバレッジ、パワー和、一様分布からの距離といった5つの主要な性質について、最適なバイアスと近似的に最適な分散が達成された。
  • ドメインサイズや信頼水準の変化にわたる対称的性質について、近似的に最適なサンプル複雑度が達成され、既知の下界と対数要因を除いて一致する。
  • ポアソン標本抽出の下での新しいMcDiarmidの不等式が確立され、これは独立に価値のある結果であり、推定器の集中解析を支援する。
  • 提案された推定器は近線形時間で計算可能であり、機械学習やデータ解析における大規模応用において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。