Skip to main content
QUICK REVIEW

[論文レビュー] Sample complexity of population recovery

Yury Polyanskiy, Ananda Theertha Suresh|arXiv (Cornell University)|Feb 18, 2017
Bayesian Methods and Mixture Models参考文献 26被引用数 7
ひとこと要約

本稿は、損失あり(消去)およびノイジィ(対称誤り)サンプリングの2つのモデルにおける母集団回復の最適な標本複雑度を確立する。損失あり回復では、標本複雑度が $\tilde{\Theta}(\delta^{-2\max\{\epsilon/(1-\epsilon),1\}})$ であり、$\epsilon = 1/2$ で段階的転移を示す。ノイジィ回復では、そのスケーリングは $\exp(\Theta(d^{1/3}\log^{2/3}(1/\delta)))$ であり、線形計画法(LP)の解法後に経験的平均推定を用いることで導出される。

ABSTRACT

The problem of population recovery refers to estimating a distribution based on incomplete or corrupted samples. Consider a random poll of sample size $n$ conducted on a population of individuals, where each pollee is asked to answer $d$ binary questions. We consider one of the two polling impediments: (a) in lossy population recovery, a pollee may skip each question with probability $ε$, (b) in noisy population recovery, a pollee may lie on each question with probability $ε$. Given $n$ lossy or noisy samples, the goal is to estimate the probabilities of all $2^d$ binary vectors simultaneously within accuracy $δ$ with high probability. This paper settles the sample complexity of population recovery. For lossy model, the optimal sample complexity is $ ildeΘ(δ^{-2\max\{\fracε{1-ε},1\}})$, improving the state of the art by Moitra and Saks in several ways: a lower bound is established, the upper bound is improved and the result depends at most on the logarithm of the dimension. Surprisingly, the sample complexity undergoes a phase transition from parametric to nonparametric rate when $ε$ exceeds $1/2$. For noisy population recovery, the sharp sample complexity turns out to be more sensitive to dimension and scales as $\exp(Θ(d^{1/3} \log^{2/3}(1/δ)))$ except for the trivial cases of $ε=0,1/2$ or $1$. For both models, our estimators simply compute the empirical mean of a certain function, which is found by pre-solving a linear program (LP). Curiously, the dual LP can be understood as Le Cam's method for lower-bounding the minimax risk, thus establishing the statistical optimality of the proposed estimators. The value of the LP is determined by complex-analytic methods.

研究の動機と目的

  • 欠損または破損した標本から高次元分布を推定する際の根本的統計的限界を特定すること。
  • 部分的または誤った観測から学習する際に中心的である損失ありおよびノイジィな母集団回復モデルにおける標本複雑度を解明すること。
  • 個々の回復と母集団回復の解析を統一し、対数因子を除いて同じ標本複雑度であることを示すこと。
  • 特にレ・カムの方法を用いた最小最大理論と複素解析の道具を用いて、鋭い上界および下界を導出すること。
  • 最適推定器が、線形計画法を解いて得られる適切に構築された関数の経験的平均であることを示すこと。

提案手法

  • 提案する推定器は、統計的最適性を保証するために事前に計算された線形計画法(LP)から得られる関数の経験的平均を計算する。
  • LPの双対は、最小最大下界を導出するためのレ・カムの方法として解釈され、推定器の統計的最適性が確立される。
  • 生成関数の $H^\infty$-ノルムの境界とテイラー級数解析を用いた複素解析的手法が、LPの値を評価するために用いられる。
  • 損失ありモデルでは、パーサバルの定理とシュワルツの不等式を用いて、回復誤差に関連する生成関数の $A$-ノルムを評価する。
  • ノイジィモデルでは、ラゲール多項式を含む生成関数と漸近的境界を用いて $A$-ノルムを制御し、$d$ に依存する指数的依存を導出する。
  • 解析により、標本複雑度が $\epsilon = 1/2$ で段階的転移を示すことが判明し、パrametricレートから非パラメトリックレートへと移行する。

実験結果

リサーチクエスチョン

  • RQ1損失あり(消去)モデルにおける母集団回復の最適な標本複雑度は何か? また、消去確率 $\epsilon$ と精度 $\delta$ にどのように依存するか?
  • RQ2ノイジィな母集団回復における標本複雑度は次元 $d$ および精度 $\delta$ に対してどのようにスケーリングされ、正確な依存関係は何か?
  • RQ3適切な関数変換を施した経験的平均推定器は、両モデルにおいて最小最大最適レートに達するか?
  • RQ4双対LPは最小最大下界を確立するために果たす役割は何か? また、レ・カムの方法とどのように関係するか?
  • RQ5なぜ損失ありモデルでは $\epsilon = 1/2$ で段階的転移が生じるのか? そして、これは収束レートにどのように影響するか?

主な発見

  • 損失あり母集団回復モデルでは、最適な標本複雑度が $\tilde{\Theta}(\delta^{-2\max\{\epsilon/(1-\epsilon),1\}})$ であり、次元への依存を対数的順序にまで削減することで、先行研究を改善し、タイトな下界を確立している。
  • 段階的転移は $\epsilon = 1/2$ で発生する:$\epsilon < 1/2$ の場合、レートはパラメトリック($\delta^{-2}$)であり、$\epsilon > 1/2$ の場合、非パラメトリック($\delta^{-2\epsilon/(1-\epsilon)}$)に移行する。
  • ノイジィ母集団回復モデルでは、最適な標本複雑度は $\exp(\Theta(d^{1/3}\log^{2/3}(1/\delta)))$ であり、損失ありの場合よりも次元に極めて敏感である。
  • 提案された推定器は、線形計画法を解いて得られる関数の経験的平均であり、その最適性はレ・カムの最小最大下界と双対性によって裏付けられる。
  • LPの値は、生成関数の $H^\infty$-ノルムの境界とラゲール多項式の漸近的解析を用いた複素解析的手法により決定される。
  • 解析により、両モデルにおける標本複雑度は、損失ありの場合には次元 $d$ に依存しない(対数因子を除いて)、一方ノイジィの場合には $d^{1/3}$ の指数的増加を示すことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。