Skip to main content
QUICK REVIEW

[論文レビュー] High-dimensional nonparametric density estimation via symmetry and shape constraints

Min Xu, Richard J. Samworth|arXiv (Cornell University)|Mar 14, 2019
Point processes and geometric inequalities参考文献 40被引用数 8
ひとこと要約

本稿では、対称性と形状制約を用いた高次元非パラメトリック密度推定法を提案する。具体的には、超レベル集合が凸体 K のスカラー倍である K-同位対称対数凹密度を用いる。対数凹性と同位性を活用することで、次元 p に依存しない最悪ケースの二乗ヘルンゲルリスク O(n⁻⁴/⁵) を達成し、次元の curse を回避する。また、生成関数が少数のセグメントを持つ区分的線形関数の場合、ほぼパラメトリックなレートに適応する。

ABSTRACT

We tackle the problem of high-dimensional nonparametric density estimation by taking the class of log-concave densities on $\mathbb{R}^p$ and incorporating within it symmetry assumptions, which facilitate scalable estimation algorithms and can mitigate the curse of dimensionality. Our main symmetry assumption is that the super-level sets of the density are $K$-homothetic (i.e. scalar multiples of a convex body $K \subseteq \mathbb{R}^p$). When $K$ is known, we prove that the $K$-homothetic log-concave maximum likelihood estimator based on $n$ independent observations from such a density has a worst-case risk bound with respect to, e.g., squared Hellinger loss, of $O(n^{-4/5})$, independent of $p$. Moreover, we show that the estimator is adaptive in the sense that if the data generating density admits a special form, then a nearly parametric rate may be attained. We also provide worst-case and adaptive risk bounds in cases where $K$ is only known up to a positive definite transformation, and where it is completely unknown and must be estimated nonparametrically. Our estimation algorithms are fast even when $n$ and $p$ are on the order of hundreds of thousands, and we illustrate the strong finite-sample performance of our methods on simulated data.

研究の動機と目的

  • 形状および対称性制約を組み込むことで、高次元非パラメトリック密度推定における次元の curse を解消すること。
  • n および p がそれぞれ数十万に達する高次元データに対して、スケーラブルでチューニングフリーの推定アルゴリズムを開発すること。
  • 未知の超レベル集合 K および中心化ベクトル µ に関するさまざまな仮定の下での理論的リスクバウンドを確立すること。
  • 例えば区分的線形生成関数を持つような低複雑度の密度に対して、ほぼパラメトリックなレートに適応することを示すこと。
  • K および µ が未知の場合に、K と µ を推定する計算効率の良いプラグインアプローチを提供すること。特に、非パラメトリックな K 推定に新しい凸包ベースのアルゴリズムを提案する。

提案手法

  • K-同位対数凹密度のクラスを、f(x) = exp(φ(‖x−µ‖_K)) として定義する。ここで φ は凹かつ単調減少であり、‖·‖_K は凸体 K のミンコフスキー汎関数である。
  • チューニングパラメータが存在しないことから、計算的に取り扱いやすい K-同位対数凹密度クラス内での最尤推定(MLE)を用いる。
  • 平均が有限である分布のクラスから K-同位対数凹密度クラスへの同位的かつ対数凹な射影 ψ*_{K,µ} を確立し、プラグイン推定量 ˆfn = ψ*_{K̂,μ̂}(P_n) を可能にする。
  • 境界推定値を用いたランダムな方向における錐領域内のデータ点の平均ユークリッドノルムを計算し、その境界推定値の凸包を用いて K の非パラメトリック推定を行う。
  • リスクバウンドを導出する際、d²_X(ˆfn, f₀) = (1/n)∑ log(ˆfn(X_i)/f₀(X_i)) という発散測度を用いる。この測度は、カルバック・ライブラー、二乗ヘルンゲル、全変動リスクを上界で抑えられる。
  • ヘウスドルフ距離およびスケール歪み(dscale)を含む幾何確率的手法を用いて、推定されたと真の超レベル集合 K 間の乖離を制御する。

実験結果

リサーチクエスチョン

  • RQ1対称性および形状制約を用いることで、高次元非パラメトリック密度推定における収束レートを向上させることができるか?
  • RQ2K および µ が既知のとき、K-同位対数凹 MLE の理論的リスクバウンドは何か?また、次元 p に依存するか?
  • RQ3生成関数 φ が単純な関数(例えば区分的線形関数)である密度に対して、推定量はどのように適応するか?
  • RQ4K および µ が未知であり推定が必要な場合、特に半パラメトリックおよび非パラメトリックな設定においてリスクバウンドは何か?
  • RQ5同位的および対数凹制約の下で、高次元密度推定に適したスケーラブルでチューニングフリーのアルゴリズムを構築できるか?

主な発見

  • K および µ が既知の場合、K-同位対数凹 MLE は次元 p に依存しない最悪ケースの二乗ヘルンゲルリスク O(n⁻⁴/⁵) を達成する。
  • 真の密度が k 個のセグメントを持つ区分的線形生成関数に対応する場合、リスクは O(k/n log⁵/⁴(en/k)) で抑えられ、k が小さい場合にはほぼパラメトリックなレートに近づく。
  • K = Σ₀¹ᐟ²K₀(K₀ は既知、Σ₀ は未知)である半パラメトリック設定では、最悪ケースの二乗ヘルンゲルリスクが polylogarithmic 要素を除いて O(p³ᐟ²/n¹ᐟ²) である。
  • 滑らかまたは 1-アフィン生成関数を持つ半パラメトリック設定では、適応レートはそれぞれ O(n⁻⁴ᐟ⁵ + p³/n) および O(p³/n) であり、対数因子を除いて成り立つ。
  • K が任意の形状である非パラメトリック設定では、提案された凸包ベースの K 推定器は、M 個のランダムな方向を使用した場合、最悪ケースの二乗ヘルンゲルリスクが O((log M / M)¹ᐟᵖ⁻¹) である。
  • 実験的分析により、有限標本でも優れた性能を示し、n, p ~ 10⁵ の大規模データでも高速に計算可能であり、高次元において標準的な非パラメトリック手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。