Skip to main content
QUICK REVIEW

[論文レビュー] Combined l_1 and greedy l_0 penalized least squares for linear model selection

Piotr Pokarowski, Jan Mielniczuk|arXiv (Cornell University)|Oct 22, 2013
Statistical Methods and Inference参考文献 37被引用数 13
ひとこと要約

本稿では、予測子スクリーニングにℓ₁正則化Lassoを、モデル選択に一般化情報基準(GIC)を用いた勾配なしℓ₀正則化最小二乗法を組み合わせた、3段階のスクリーニング–順序付け–選択(SOS)アルゴリズムを提案する。この手法は、Lasso単独よりも弱い条件下でも選択一貫性を達成でき、主な結果として、勾配なしGIC選択が全探索GICと比較して漸近的に高い誤り確率を示さないことが示され、計算コストを著しく削減する一方で精度を損なわない。

ABSTRACT

We introduce a computationally effective algorithm for a linear model selection consisting of three steps: screening--ordering--selection (SOS). Screening of predictors is based on the thresholded Lasso that is l_1 penalized least squares. The screened predictors are then fitted using least squares (LS) and ordered with respect to their t statistics. Finally, a model is selected using greedy generalized information criterion (GIC) that is l_0 penalized LS in a nested family induced by the ordering. We give non-asymptotic upper bounds on error probability of each step of the SOS algorithm in terms of both penalties. Then we obtain selection consistency for different (n, p) scenarios under conditions which are needed for screening consistency of the Lasso. For the traditional setting (n >p) we give Sanov-type bounds on the error probabilities of the ordering--selection algorithm. Its surprising consequence is that the selection error of greedy GIC is asymptotically not larger than of exhaustive GIC. We also obtain new bounds on prediction and estimation errors for the Lasso which are proved in parallel for the algorithm used in practice and its formal version.

研究の動機と目的

  • p > n の場合に高次元線形モデル選択において、計算的に効率的かつ選択一貫性を持つ手法を開発すること。
  • Lassoが非表現可能条件のため正しいモデルを選択できないという限界を、スクリーニングと勾配選択ステップを組み合わせることで解決すること。
  • 勾配なしℓ₀正則化最小二乗法(GICを介して)が、全探索と比較して誤り確率が漸近的に大きくならないことを示すこと。
  • 各SOSアルゴリズムステップにおける誤り確率の非漸近的上限を、LassoおよびGIC正則化項の観点から導出すること。

提案手法

  • スクリーニングステップでは、予測子数をn以下にまで削減するために、しきい値を設定したLasso(ℓ₁正則化最小二乗法)を用いる。
  • 順序付けステップでは、スクリーニング済みの予測子を、スクリーニングセット上で全最小二乗回帰のt統計量に基づいて順位付けする。
  • 選択ステップでは、順序付けによって導かれるネストされたモデル族に対して、ℓ₀正則化項を用いたGIC正則化最小二乗法を用いた勾配探索を適用する。
  • GIC正則化項は、適合度が良く、複雑性が低いモデルを優先するように、最適なモデルを選択する。
  • LassoおよびGIC正則化項を用いて、各ステップにおける誤り確率の非漸近的上界を導出する。
  • 理論的分析により、制限等方性性(RIP)および弱いβ-min条件の下で、相関のある予測子が存在する場合でさえも選択一貫性が確立される。

実験結果

リサーチクエスチョン

  • RQ1ℓ₁およびℓ₀正則化最小二乗法を組み合わせた3段階のアルゴリズムが、高次元線形モデルにおいて選択一貫性を達成できるか。
  • RQ2GICを介した勾配なしℓ₀正則化最小二乗法の選択誤り確率が、全探索と比較して漸近的に大きくならないか。
  • RQ3しきい値を設定したLassoが、その後続のモデル選択を支えるためにスクリーニング一貫性を満たす条件は何か。
  • RQ4スクリーニング、順序付け、選択の各ステップにおける非漸近的誤り確率の上限が、LassoおよびGIC正則化項にどのように依存するか。
  • RQ5予測子が高次元に相関している、または誤った予測子が複製されている場合でも、提案されたSOSアルゴリズムが選択一貫性を維持できるか。

主な発見

  • SOSアルゴリズムは、制限等方性性(RIP)および弱いβ-min条件の下で、予測子が高次元に相関していても選択一貫性を達成する。
  • 勾配なしGICステップにおける選択誤り確率は、漸近的に全探索GICのそれ以上にならないため、誤りリスクが増加しない。
  • 各SOSステップにおける誤り確率の非漸近的上界が、LassoおよびGIC正則化項の観点から導出された。
  • 本手法は、実用的および形式的両方のバージョンに対して、Lassoの予測誤差および推定誤差に関する新たな非漸近的境界を提供する。
  • n > p の設定において、pと|T|が無限大に発散する場合に適用可能な、選択誤りの一般境界が導出され、GIC正則化項はnのオーダーである。
  • 理論的結果により、SOSアルゴリズムがLassoスクリーニング一貫性に十分な条件を満たす場合に、選択一貫性を維持することが確認され、現実的な高次元設定への適用範囲が拡張される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。