Skip to main content
QUICK REVIEW

[論文レビュー] Convex programming approach to robust estimation of a multivariate Gaussian model

Samuel Balmand, Arnak S. Dalalyan|arXiv (Cornell University)|Dec 15, 2015
Advanced Statistical Methods and Models参考文献 27被引用数 5
ひとこと要約

本稿では、敵対的外れ値が存在する状況下でも、多変量正規分布の平均および共分散行列をロバストに推定するための凸最適化に基づく推定量を提案する。ペナルティ付き平方根最小二乗損失を、普遍的な調整パrameterで最小化することで、エントリごとの ℓ₁、フロベニウス、および混合 ℓ₂/ℓ₁ 範囲において、同時にレート最適な推定が達成される。変数の数が標本サイズを上回る高次元設定下でも、スパarsity仮定のもとで成立する。

ABSTRACT

Multivariate Gaussian is often used as a first approximation to the distribution of high-dimensional data. Determining the parameters of this distribution under various constraints is a widely studied problem in statistics, and is often considered as a prototype for testing new algorithms or theoretical frameworks. In this paper, we develop a nonasymptotic approach to the problem of estimating the parameters of a multivariate Gaussian distribution when data are corrupted by outliers. We propose an estimator---efficiently computable by solving a convex program---that robustly estimates the population mean and the population covariance matrix even when the sample contains a significant proportion of outliers. Our estimator of the corruption matrix is provably rate optimal simultaneously for the entry-wise $\ell_1$-norm, the Frobenius norm and the mixed $\ell_2/\ell_1$ norm. Furthermore, this optimality is achieved by a penalized square-root-of-least-squares method with a universal tuning parameter (calibrating the strength of the penalization). These results are partly extended to the case where $p$ is potentially larger than $n$, under the additional condition that the inverse covariance matrix is sparse.

研究の動機と目的

  • データに顕著な外れ値が含まれる状況下でも、非漸近的かつロバストな多変量正規分布パラメータ推定量の開発。
  • 複数の行列ノルム(ℓ₁、フロベニウス、混合 ℓ₂/ℓ₁)において、平均および共分散行列のレート最適推定の達成。
  • 逆共分散行列にスパarsity制約を課した高次元設定(p > n)へのこの手法の拡張。
  • 凸最適化と普遍的な調整パrameterを用いた推定量の性能に対する理論的保証の提供。
  • 既存のロバスト推定量の限界を補うために、データ適合性とスパarsity促進ペナルティを統合する。

提案手法

  • 推定量は、残差行列の混合 ℓ₂/ℓ₁ ノルムとペナルティ付き平方根最小二乗項を組み合わせた凸コスト関数の最小化として定義される。
  • データ適合性項は、残差行列の混合 ℓ₂/ℓ₁ ノルムを用いて観測データからの逸脱を測定する。
  • 外れ値をモデル化するための不正行列にスパarsity促進ペナルティを適用し、外れ値パターンのスパarsityを促進する。
  • ペナルティは不正行列の混合 ℓ₂/ℓ₁ ノルムに比例しており、高次元外れ値に対してもロバスト性を実現する。
  • 高次元ケース(p > n)では、逆共分散行列に追加の重み付き ℓ₁ ペナルティを適用してスパarsityを強制する。
  • ペナルティ強度の調整に普遍的な調整パrameterを用い、交差検証を回避する。

実験結果

リサーチクエスチョン

  • RQ1凸最適化フレームワークは、一般のノルム損失下で、多変量正規分布パラメータのレート最適なロバスト推定を達成できるか?
  • RQ2変数の数 p が標本サイズ n を上回る場合、提案手法の推定量はどのように動作するか?
  • RQ3普遍的な調整パrameterの使用は、データ依存の補正なしに最適なレートを達成するのに十分か?
  • RQ4高次元スパarsity仮定下での推定量の理論的性能保証は何か?
  • RQ5複数の行列ノルム(ℓ₁、フロベニウス、ℓ₂/ℓ₁)において、同時に最適な誤差率を達成できるか?

主な発見

  • 提案手法は、不正行列のエントリごとの ℓ₁ ノルム、フロベニウス ノルム、混合 ℓ₂/ℓ₁ ノルムにおいて、同時にレート最適な誤差バウンドを達成する。
  • 普遍的な調整パrameterを用いたペナルティ付き平方根最小二乗法により、データ駆動型補正の必要がなくなる。
  • 高次元設定(p > n)下でも、逆共分散行列がスパースであるという仮定のもとで理論的有効性を維持する。
  • 制限固有値条件が経験的共分散行列に成り立つ場合の理論的リスクバウンドが確立されたが、その確率は未同定のままである。
  • 実験的結果から、特に外れ値が30%に達するような高外れ値汚染状況下でも、最先端のロバスト推定量と同等の性能を示す。
  • 識別された外れ値を除去した後、精度行列を再推定することで推定誤差がさらに低減するため、二段階の精製プロセスが性能向上に寄与することが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。