Skip to main content
QUICK REVIEW

[論文レビュー] Pivotal Estimation via Self-Normalization for High-Dimensional Linear Models with Error in Variables

Alexandre Belloni, Abhishek Kaul|arXiv (Cornell University)|Aug 28, 2017
Statistical Methods and Inference参考文献 28被引用数 15
ひとこと要約

本稿は、予測変数の数が標本サイズを上回る高次元線形モデルにおける誤差あり変数のための決定的推定法を導入する。推定制約に自己正規化を適用することにより、未知のノイズレベルに依存する調整パrameterの必要性が排除され、2次錐計画法を用いた信頼性の高い計算が可能となり、スパarsity仮定の下で最適な $\beta$-収束率を達成する。

ABSTRACT

We propose a new estimator for the high-dimensional linear regression model with observation error in the design where the number of coefficients is potentially larger than the sample size. The main novelty of our procedure is that the choice of penalty parameters is pivotal. The estimator is based on applying a self-normalization to the constraints that characterize the estimator. Importantly, we show how to cast the computation of the estimator as the solution of a convex program with second order cone constraints. This allows the use of algorithms with theoretical guarantees and reliable implementation. Under sparsity assumptions, we derive $\ell_q$-rates of convergence and show that consistency can be achieved even if the number of regressors exceeds the sample size. We further provide a simple to implement rule to threshold the estimator that yields a provably sparse estimator with similar $\ell_2$ and $\ell_1$-rates of convergence. The thresholds are data-driven and component dependents. Finally, we also study the rates of convergence of estimators that refit the data based on a selected support with possible model selection mistakes. In addition to our finite sample theoretical results that allow for non-i.i.d. data, we also present simulations to compare the performance of the proposed estimators.

研究の動機と目的

  • 予測変数が測定誤差を伴い、予測変数の数 $p$ が標本サイズ $n$ を上回る高次元線形モデルに対処すること。
  • 調整パrameterが決定的(pivotal)—すなわち、未知のノイズ分散や $\beta_0$-ノルムに依存しない—推定量を構築することにより、モデル固有の調整知識に依存しないようにすること。
  • 2次錐制約を有する凸計画問題として定式化することにより、計算の信頼性を確保すること。
  • スパarsity仮定の下で $\beta_q$-ノルムの収束速度を導出し、$p \gg n$ の場合でも一貫性を示し、明示的にスパースなサポートを持つ閾値処理推定量を構築すること。
  • モデル選択誤りが再適合推定量に与える影響を分析し、非i.i.d.設計のもとで有限標本保証を提供すること。

提案手法

  • 解を定義する制約に自己正規化を施すことにより推定量を構築し、2次錐制約を有する凸計画問題に変換する。
  • 自己正規化手順により調整パrameterが決定的となり、未知のノイズ分散や $\beta_0$-ノルムへの依存が排除される。
  • 補助データが利用可能であるか、欠損がランダムであると仮定する応用分野で利用可能な測定誤差共分散行列 $\Gamma$ のデータ駆動推定量 $\hat{\Gamma}$ を活用する。
  • スパarsityを強制するために推定量の閾値処理版を提案し、成分別でデータ駆動の閾値を用いることで、最適な $\ell_2$ および $\ell_1$ 収束率を維持する。
  • 理論的分析は、サブガウス分布の集中不等式と最大不等式を用いた確率的誤差項の高確率バウンドに依拠する。
  • 一般設計仮定(非i.i.d.データを含む)のもとで有限標本結果を導出し、推定量の性能を比較するシミュレーションにより裏付けられる。

実験結果

リサーチクエスチョン

  • RQ1ノイズ分散や真の係数ベクトルの $\ell_2$-ノルムの知識がなくても、測定誤差を伴う高次元線形モデルを推定可能か?
  • RQ2調整パrameterを未知のモデルパrameterに依存させず、最適な収束率を維持できるようにするにはどうすればよいか?
  • RQ3測定誤差が存在する状況で、モデル選択ミスが再適合推定量の性能に与える影響は何か?
  • RQ4$p \gg n$ の場合でも、理論的保証を伴う凸最適化により効率的に推定量を計算可能か?
  • RQ5非i.i.d.設計およびサブガウス誤差構造のもとで、推定量の有限標本収束速度は何か?

主な発見

  • 提案された推定量は、$\ell_q$-収束速度 $s^{1/q}\sqrt{\log p / n}$ を達成し、測定誤差を伴う高次元モデルにおけるミニマックス最適レートと一致する。
  • 調整パrameterが決定的である—$\sigma_\xi^2$、$\sigma_w^2$、$\|\beta_0\|_2$ の知識は不要—これにより、頑健で自動的な実装が可能になる。
  • 推定量は2次錐制約を有する凸計画問題の解として計算可能であり、アルゴリズムの信頼性と収束保証が得られる。
  • 閾値処理版の推定量は、同じ $\ell_2$ および $\ell_1$ 収束率を達成するスパース解を提供し、成分別でデータ駆動の閾値を用いる。
  • 理論的結果は、欠損がランダムな設定を含む非i.i.d.設計のもとでも成り立つため、i.i.d.仮定を越えて応用範囲が広がる。
  • シミュレーションにより、推定量の優れた有限標本性能が確認され、特に未知のノイズパラメータに基づく調整を要する手法と比較して顕著な優位性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。