Skip to main content
QUICK REVIEW

[論文レビュー] Robustly Learning any Clusterable Mixture of Gaussians

Ilias Diakonikolas, Samuel B. Hopkins|arXiv (Cornell University)|May 13, 2020
Machine Learning and Algorithms参考文献 36被引用数 15
ひとこと要約

本稿では、敵対的汚染下において任意のクラスタブルなガウス混合分布を多項式時間でロバストに学習する最初のアルゴリズムを提示する。全変動距離において近似的に最適な誤差 $ ilde{O}( au)$ を達成する。この手法は、反拡散性とパラメータ距離の特徴付けを用いた、新しいSum-of-Squares(SoS)ベースの同定可能性証明を活用し、成分の平均が同一であったり、任意の共分散をとったりしても、それらの対間の重複が $ au$ の多項式に制限される限り、ロバストなクラスタリングを保証する。主な貢献は、正確なクラスタリングが可能な最小限の分離条件のもとで、証明可能に効率的かつロバストな学習フレームワークを確立したことである。

ABSTRACT

We study the efficient learnability of high-dimensional Gaussian mixtures in the outlier-robust setting, where a small constant fraction of the data is adversarially corrupted. We resolve the polynomial learnability of this problem when the components are pairwise separated in total variation distance. Specifically, we provide an algorithm that, for any constant number of components $k$, runs in polynomial time and learns the components of an $ε$-corrupted $k$-mixture within information theoretically near-optimal error of $ ilde{O}(ε)$, under the assumption that the overlap between any pair of components $P_i, P_j$ (i.e., the quantity $1-TV(P_i, P_j)$) is bounded by $\mathrm{poly}(ε)$. Our separation condition is the qualitatively weakest assumption under which accurate clustering of the samples is possible. In particular, it allows for components with arbitrary covariances and for components with identical means, as long as their covariances differ sufficiently. Ours is the first polynomial time algorithm for this problem, even for $k=2$. Our algorithm follows the Sum-of-Squares based proofs to algorithms approach. Our main technical contribution is a new robust identifiability proof of clusters from a Gaussian mixture, which can be captured by the constant-degree Sum of Squares proof system. The key ingredients of this proof are a novel use of SoS-certifiable anti-concentration and a new characterization of pairs of Gaussians with small (dimension-independent) overlap in terms of their parameter distance.

研究の動機と目的

  • 高次元ガウス混合分布の敵対的汚染下における多項式的学習可能性を解消すること。ここでの汚染は、データの定数割合までを含む。
  • 正確なクラスタリングが情報理論的に可能となる最小限の分離条件を確立すること。この条件は、対間の全変動距離による重複が $\mathrm{poly}(\tau)$ に有界であることで定義される。
  • 任意の共分散と同一の平均を持つ $k$ 成分ガウス混合分布を、パラメータ距離が重複を小さく保証する限り、ロバストかつ効率的に学習するアルゴリズムを開発すること。
  • ガウス混合分布の構造を捕捉できる新しいSoSフレームワークに基づくロバスト同定可能性証明を提供すること。
  • $k=2$ であっても、真の成分と推定成分間の全変動距離において、近似的に最適な誤差 $\tilde{O}(\tau)$ を達成すること。

提案手法

  • アルゴリズムは、Sum-of-Squares(SoS)証明システムを用いて、敵対的汚染下でもクラスタが区別可能であることを証明することで、クラスタのロバスト同定可能性を確立する。
  • クラスタ間の差が生じる領域における確率質量の下界を保証するため、SoS証明可能な反拡散性の新しい応用が採用される。これにより、ロバストな分離が可能になる。
  • 2つのガウス分布の重複が次元に依存しない小さな値をとる場合の、パラメータ距離による新しい特徴付けが導入され、最小限の分離条件下でのロバストクラスタリングを可能にする。
  • ロバストなクラスタリングと、擬似クラスタの分散バウンドを用いて汚染済みデータからクリーンなサンプルを分離するデコルプションステップを組み合わせる。
  • トーナメントベースの選択手順により、複数の候補クラスタリングのうち最良の仮説を特定し、誤差バウンドが $O(\tau \log(1/\tau))$ のスケールに保たれることを保証する。
  • 最後に、再クラスタリングされたサンプルに対してロバスト推定を適用し、成分パラメータを精緻化することで、全変動距離誤差が $\tilde{O}(\tau)$ に達する。

実験結果

リサーチクエスチョン

  • RQ1敵対的汚染下でも、平均が同一または任意の共分散を持つ場合を含め、任意のクラスタブルなガウス混合分布を多項式時間で学習できるアルゴリズムは存在するか?
  • RQ2正確なガウス混合成分のクラスタリングが情報理論的に可能となる最小限の分離条件は何か?
  • RQ3標準的なモーメントベースの手法が失敗する状況下でも、Sum-of-Squares(SoS)フレームワークを用いてガウス混合成分のロバスト同定可能性を証明できるか?
  • RQ4$ au$-corruption下でも、$k=2$ であっても、全変動距離において近似的に最適な $ ilde{O}(\tau)$ の誤差を達成することは可能か?
  • RQ5高次元混合分布におけるロバストクラスタリングを証明するために、SoSフレームワーク内で反拡散性の性質を活用できるか?

主な発見

  • 本稿では、$\tau$-corruption下でも、$k=2$ であっても、最小限の分離条件のもとで、$k$ 成分ガウス混合分布をロバストに学習する最初の多項式時間アルゴリズムを提示する。
  • 真の成分と推定成分間の全変動距離誤差が $\tilde{O}(\tau)$ に達する。これは情報理論的に近似的に最適である。
  • 分離条件は、対間の重複 $1 - \mathrm{TV}(P_i, P_j) \leq \mathrm{poly}(\tau)$ で定義され、平均が同一であっても、共分散が十分に異なる限り、許容される。
  • 主な技術的イノベーションは、モーメントバウンドを要件としない、新しいSoS証明可能な反拡散性の議論である。これにより、ロバストな同定可能性が可能になる。
  • 任意の成分共分散と非一様な混合重みを効果的に処理でき、最終推定ステップでの誤差は $O(\tau \log(1/\tau))$ のスケールに保たれる。
  • このフレームワークは非一様混合分布へ一般化可能であり、正しいクラスタリングに高い確率で収束するロバストな仮説選択手順を含む。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。