Skip to main content
QUICK REVIEW

[論文レビュー] Confidence regions for high-dimensional generalized linear models under sparsity

Jana Janková, Sara van de Geer|arXiv (Cornell University)|Oct 5, 2016
Statistical Methods and Inference参考文献 9被引用数 16
ひとこと要約

本稿は、スパarsityのもとで高次元一般化線形モデルにおける低次元パラメータのバイアス補正済み・脱スパース化推定量を提案し、微分不能な損失関数(分位数、Huber、ハングイン損失など)に対しても漸近正規性の推論と有効な信頼領域の構築を可能にする。本手法は、新規の逆フィッシャー情報行列推定量とエントロピーに基づく正則性条件を用いて、仮説検定および信頼区間における一様有効性を達成する。

ABSTRACT

We study asymptotically normal estimation and confidence regions for low-dimensional parameters in high-dimensional sparse models. Our approach is based on the $\ell_1$-penalized M-estimator which is used for construction of a bias corrected estimator. We show that the proposed estimator is asymptotically normal, under a sparsity assumption on the high-dimensional parameter, smoothness conditions on the expected loss and an entropy condition. This leads to uniformly valid confidence regions and hypothesis testing for low-dimensional parameters. The present approach is different in that it allows for treatment of loss functions that we not sufficiently differentiable, such as quantile loss, Huber loss or hinge loss functions. We also provide new results for estimation of the inverse Fisher information matrix, which is necessary for the construction of the proposed estimator. We formulate our results for general models under high-level conditions, but investigate these conditions in detail for generalized linear models and provide mild sufficient conditions. As particular examples, we investigate the case of quantile loss and Huber loss in linear regression and demonstrate the performance of the estimators in a simulation study and on real datasets from genome-wide association studies. We further investigate the case of logistic regression and illustrate the performance of the estimator on simulated and real data.

研究の動機と目的

  • 高次元スパースモデルにおける低次元パラメータの、一様有効な信頼領域および仮説検定の開発を目的とする。
  • 微分可能でない損失関数(分位数、Huber、ハングイン損失など)の範囲を越えて、漸近正規性の推論を拡張することを目的とする。
  • Lassoに基づくバイアス補正推定量を構築し、緩い正則性条件およびエントロピー条件のもとで漸近正規性を達成することを目的とする。
  • 高次元設定における分散推定に必要な逆フィッシャー情報行列の新しい推定量を提供することを目的とする。
  • 実データおよびシミュレートデータを用いた実証的検証を実施し、超高次元設計を有する全ゲノム関連解析にも適用することを目的とする。

提案手法

  • スパarsityと変数選択を達成するため、初期推定量としてL1正則化M推定量を用いる。
  • 正則化によって生じる推定量のバイアスを除去するため、Lasso推定量にバイアス補正を施す。
  • スパarsity、損失関数の滑らかさ、およびエントロピー条件のもとで、脱バイアス推定量の漸近正規性を導出する。
  • 交差検証を回避するため、ノードワイズのスルーレートLasso手順を用いて逆フィッシャー情報行列を推定する。
  • 高次元推論における誤り率を制御するため、多重検定補正(ボンフェローニ=ホルムおよびベンジャミニ=ホッジス)を採用する。
  • 線形回帰(分位数損失・Huber損失)およびロジスティック回帰を含む、一般化線形モデルへのフレームワークの適用を実施する。

実験結果

リサーチクエスチョン

  • RQ1高次元一般化線形モデルにおいてスパarsityのもとで、低次元パラメータの有効な信頼領域を構築できるか?
  • RQ2分位数損失やHuber損失のような非微分可能損失関数に基づく推定量において、どのようにして漸近正規性を達成できるか?
  • RQ3高次元モデルにおける推論の一様有効性を保証するための十分な正則性およびエントロピー条件は何か?
  • RQ4チューニングパrameterの選択を伴わず、高次元設定において逆フィッシャー情報行列を一貫して推定するにはどうすればよいか?
  • RQ5全ゲノム関連解析のような超高次元実世界データにおいて、脱スパース化推定量は実際にどの程度の性能を示すか?

主な発見

  • 脱スパース化推定量は、スパarsity、損失関数の滑らかさ、およびエントロピー条件のもとで漸近正規性を達成し、有効な信頼領域の構築を可能にする。
  • 本手法は、従来のM推定量理論ではカバーされていない非微分可能損失関数(分位数、Huber、ハングイン損失)を効果的に扱える。
  • 6033個の遺伝子と102サンプルを有する前立腺がんデータセットにおいて、脱スパース化ロジスティックLassoは遺伝子515を有意と特定した(係数推定値:-2.4677)ほか、しきい値処理後に遺伝子4639および5503も有意であった。
  • 4088個の遺伝子と72サンプルを有する全ゲノム関連解析において、脱スパース化LAD推定量はボンフェローニ=ホルム補正のもとでRPSB_at(p値 0.05)およびYCEI_at(p値 0.14)を有意と特定した。
  • 多重検定補正により結果が保守的となり、非常に多くの仮説を検討する超高次元設定では少数の遺伝子しか選択されなかったが、これは予想される結果であった。
  • 逆フィッシャー情報行列のノードワイズスルーレートLasso推定量は交差検証を回避でき、実用的に良好な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。