Skip to main content
QUICK REVIEW

[論文レビュー] Robust subgaussian estimation of a mean vector in nearly linear time

Jules Depersin, Guillaume Lecué|arXiv (Cornell University)|Jun 7, 2019
Machine Learning and Algorithms被引用数 8
ひとこと要約

この論文は、重い尾を持つデータおよび外れ値が混入したデータに対して、ほぼ線形時間 $\tilde{\cal O}(Nd)$ でサブガウス型レートを達成するロバストな平均推定アルゴリズムを提示する。このアルゴリズムは、メジアン・オブ・ミーンズの原則とカバーング半定値計画法の新規な組み合わせを用いる。アルゴリズムは未知の外れ値数に適応し、汚染度や分布パラメータの事前知識なしに最適な統計的性能を達成する。

ABSTRACT

We construct an algorithm, running in time $ ilde{\mathcal O}(N d + uK d)$, which is robust to outliers and heavy-tailed data and which achieves the subgaussian rate from [Lugosi, Mendelson] \begin{equation}\label{eq:intro_subgaus_rate} \sqrt{\frac{{ m Tr}(Σ)}{N}}+\sqrt{\frac{||Σ||_{op}K}{N}} \end{equation}with probability at least $1-\exp(-c_0K)-\exp(-c_1 u)$ where $Σ$ is the covariance matrix of the informative data, $K\in\{1, \ldots, K\}$ is some parameter (number of block means) and $u>0$ is another parameter of the algorithm. This rate is achieved when $K\geq c_1 |\mathcal O|$ where $|\mathcal O|$ is the number of outliers in the database and under the only assumption that the informative data have a second moment. The algorithm is fully data-dependent and does not use in its construction the proportion of outliers nor the rate above. Its construction combines recently developed tools for Median-of-Means estimators and covering-Semi-definite Programming [Chen, Diakonikolas, Ge] and [Peng, Tangwongsan, Zhang].

研究の動機と目的

  • 最小の2次モーメントの仮定の下で、高速でデータ依存のロバストな平均推定のためのアルゴリズムを開発すること。
  • 重い尾のデータに対して、サブガウス型レートをほぼ線形時間で達成すること。これにより、従来の多項式時間法を改善する。
  • アルゴリズムの構築にあたって、外れ値数や汚染率に関する事前知識を不要にすること。
  • メジアン・オブ・ミーンズとカバーング半定値計画法の技術を組み合わせ、統計的効率性と計算的効率性の両方を達成すること。
  • データ駆動型の選択メカニズムを通じて、外れ値数への自動適応を示すこと。

提案手法

  • アルゴリズムは、座標ごとのメジアンを用いてロバスト性を初期化するメジアン・オブ・ミーンズフレームワークを出発点とする。
  • 濃度境界を用いた方向のネットワーク上で集中の性質を活用し、推定値を精緻化するためのカバーイングに基づく半定値計画法(SDP)手順を適用する。
  • 多層の探索戦略が採用され、データのダイアディック分解を用いて、ブロック平均の異なるスケールを段階的にテストする。
  • 段階ごとに、候補値の二分探索によりステップサイズを適応的に選択し、SDPを用いて各段階での進捗を検証する。
  • 最終的な推定器は、精度と計算コストのバランスを取るデータ駆動型の停止ルールに基づいて、候補の系列から選択される。
  • 構成は完全にデータ依存であり、外れ値の割合や信頼水準に関する調整パrameterを必要としない。

実験結果

リサーチクエスチョン

  • RQ1ロバストな平均推定器は、サブガウス型レートを達成しつつ、ほぼ線形時間で動作可能だろうか?
  • RQ2汚染度の事前知識なしに、未知の外れ値数に自動的に適応できるアルゴリズムは可能だろうか?
  • RQ3カバーイングSDP技術は、メジアン・オブ・ミーンズと効果的に組み合わせられ、統計的最適性と計算的効率性の両方を達成できるだろうか?
  • RQ4高次元ロバスト推定において、サブガウス型の分散確率を達成するための最小限の計算コストは何か?
  • RQ5有効なランクと外れ値数の両方に同時に適応するロバスト推定器を構築することは可能だろうか?

主な発見

  • 提案されたアルゴリズムは、高確率 $1 - \exp(-c_0 K) - \exp(-c_1 u)$ で、サブガウス型レート $\sqrt{\frac{\operatorname{Tr}(\Sigma)}{N}} + \sqrt{\frac{\|\Sigma\|_{\text{op}} K}{N}}$ を達成し、先行研究で得られた最適な統計的レートと一致する。
  • 外れ値の数 $u_j = 2^j$ の場合、アルゴリズムはほぼ線形時間 $\tilde{\cal O}(Nd)$ で実行され、サンプルサイズに対する対数的要因のない定数確率保証を達成する。
  • サブガウス型の分散確率のため、$u_j = \lceil N/2^j \rceil$ の場合、アルゴリズムは $\tilde{\cal O}(N^2 d)$ 時間で実行され、すべての $K \geq 600|\mathcal{O}|$ に対して $1 - 4\exp(-K/360000)$ の信頼水準を達成する。
  • 推定器は、$|\mathcal{O}|$ を入力として必要とせず、$|\mathcal{O}| = \epsilon N$ のとき、レート $\sqrt{\frac{\operatorname{Tr}(\Sigma)}{N}} + \sqrt{\|\Sigma\|_{\text{op}} \epsilon}$ を達成する。
  • 推定誤差が標本サイズに支配されるか、汚染に支配されるかのフェーズ遷移が、$N \sim \frac{\operatorname{Tr}(\Sigma)}{\|\Sigma\|_{\text{op}} \epsilon}$ で発生する。
  • アルゴリズムは完全にデータ依存であり、外れ値の割合や信頼水準 $\delta$ の知識を必要としないため、実世界の応用において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。