Skip to main content
QUICK REVIEW

[論文レビュー] Stepwise Choice of Covariates in High Dimensional Regression

Laurie Davies|arXiv (Cornell University)|Oct 17, 2016
Statistical Methods and Inference参考文献 11被引用数 3
ひとこと要約

本稿では、高次元線形モデルにおけるモデルフリーな段階的回帰手法を提案する。この手法は、共変数が残差平方和をどれだけ削減するかを、独立したガウスノイズの削減と比較することで共変数を選択する。正則化や交差検証、誤差分散の推定を必要とせず、ベータ分布を用いて正確なp値を導出し、一貫性を確保するとともに、シミュレーションでlassoより優れた性能を示す。

ABSTRACT

Given data y(n) and p(n)covariates x(n) one problem in linear regression is to decide which if any of the covariates to include. There are many articles on this problem but all are based on a stochastic model for the data. This paper gives what seems to be a new approach which does not require any form of model. It is conceptually and algorithmically simple and consistency results can be proved under appropriate assumptions.

研究の動機と目的

  • 線形モデルの仮定や誤差分散の推定に依存しない、高次元線形回帰における共変数選択手法の開発。
  • 正則化や交差検証を必要とせず、計算が単純かつ変換不変性を持つ、lassoなどの既存手法の代替手法の提供。
  • 実際の共変数とi.i.d.ガウスノイズの残差削減量を比較することに基づく有意性検定フレームワークの確立。
  • 正確なp値が得られない非線形およびロバスト回帰への応用を、カイ二乗分布に基づく近似を用いて拡張。
  • 高次元設定下での一貫性と、より優れた誤り発見率の制御の実証。

提案手法

  • 本手法は、ランダムなガウス共変数が実際の共変数よりも残差平方和をどれだけ多く削減する確率を、ノイズ下での残差削減の正確な分布を用いて計算する。
  • ベータ確率変数 $ B_{a,b} $ を用いて、$ SS_{\nu} \stackrel{D}{=} ss_0(1 - B_{1/2, (n - \nu_0 - 1)/2}) $ という正確な分布を用いてp値を計算する。
  • 新たな共変数を含めるためのp値は、$ \mathbf{P}(SS_{01} \leq ss_{01}) = 1 - \text{pbeta}(1 - ss_{01}/ss_0, 1/2, (n - \nu_0 - 1)/2)^{q(n) - \nu_0} $ で与えられる。
  • 停止ルールは、このp値を逆算して得られる:$ ss_{01} > ss_0 \left(1 - \text{qbeta}((1 - \alpha)^{1/(q(n) - \nu_0)}, 1/2, (n - \nu_0 - 1)/2) \right) $。
  • 本手法はアフィン変換および共変数の順列に対して不変であり、複数検定の問題を避けるために、同時確率 $ \prod_{j=1}^{\nu} (1 - p_j) $ を用いる。
  • 非線形およびロバスト回帰では、正確なp値が得られない場合、カイ二乗分布に基づく近似を用いる。

実験結果

リサーチクエスチョン

  • RQ1高次元回帰における共変数選択は、線形モデルの仮定や誤差分散の推定なしに行えるか?
  • RQ2ランダムなガウス共変数が、実際の共変数よりも残差平方和をどれだけ多く削減する確率の正確な値は何か?
  • RQ3正則化や交差検証を必要とせず、一貫性を持つ段階的選択手順をどのように構築できるか?
  • RQ4高次元設定下で、本手法はlassoよりも誤り発見率をよりよく制御できるか?
  • RQ5最小限の仮定で、ロバストおよび非線形回帰へ本手法を拡張できるか?

主な発見

  • 適切な正則性条件の下で、誤差分散の推定を必要とせず、高次元線形回帰において一貫性を達成する。
  • 共変数の含め方の正確なp値はベータ分布を用いて導出され、以前のカイ二乗近似の代わりに用いられる。
  • n=72、q(n)=3571の白血病データセットにおいて、lassoよりも誤り陽性が少なく、関連する遺伝子を正しく同定した。
  • グラフィカルモデルの再構築において、1747個の真のエッジのうち1109個が回復され、誤りエッジはたった2つにとどまり、lassoに基づく手法を上回った。
  • シミュレーションでは、高次元設定下でも低誤り発見率を維持し、エッジ回復の精度がlassoを上回った。
  • 漸近的停止ルールは $ ss_{01} > ss_0 \left(1 - \frac{2\log q(n) - \log\log q(n) - 2\log(-\log(1 - \alpha))}{n} \right) $ で与えられ、モデルフリーなしきい値を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。