Skip to main content
QUICK REVIEW

[論文レビュー] A Revisit to De-biased Lasso for Generalized Linear Models

Lu Xia, Bin Nan|arXiv (Cornell University)|Jun 23, 2020
Statistical Methods and Inference参考文献 37被引用数 8
ひとこと要約

この論文は一般化線形モデル(GLMs)におけるデバイアス付きlassoを再考し、標準的手法が逆フィッシャー情報行列のスパarsity仮定が満たされないために失敗することを特定した。著者らは、スパarsityを仮定せずにヘッセ行列を直接逆行列化することで、洗練されたデバイアス付き推定量を提案し、漸近正規性を確立し、シミュレーションおよび実データ解析において信頼区間のカバレッジが向上することを示した。

ABSTRACT

De-biased lasso has emerged as a popular tool to draw statistical inference for high-dimensional regression models. However, simulations indicate that for generalized linear models (GLMs), de-biased lasso inadequately removes biases and yields unreliable confidence intervals. This motivates us to scrutinize the application of de-biased lasso in high-dimensional GLMs. When $p >n$, we detect that a key sparsity condition on the inverse information matrix generally does not hold in a GLM setting, which likely explains the subpar performance of de-biased lasso. Even in a less challenging "large $n$, diverging $p$" scenario, we find that de-biased lasso and the maximum likelihood method often yield confidence intervals with unsatisfactory coverage probabilities. In this scenario, we examine an alternative approach for further bias correction by directly inverting the Hessian matrix without imposing the matrix sparsity assumption. We establish the asymptotic distributions of any linear combinations of the resulting estimates, which lay the theoretical groundwork for drawing inference. Simulations show that this refined de-biased estimator performs well in removing biases and yields an honest confidence interval coverage. We illustrate the method by analyzing a prospective hospital-based Boston Lung Cancer Study, a large scale epidemiology cohort investigating the joint effects of genetic variants on lung cancer risk.

研究の動機と目的

  • 高次元一般化線形モデル(GLMs)におけるデバイアス付きlassoの性能不良、特にバイアスの高い推定値と信頼性の低い信頼区間の原因を調査すること。
  • GLMsにおけるデバイアス付きlassoの失敗の根本的原因を、逆フィッシャー情報行列がスパースであるという仮定に焦点を当てて特定すること。
  • スパarsity仮定を避けるためにヘッセ行列を直接逆行列化することで、新たなデバイアス付き推定量を開発すること。
  • 有効な統計的推論のための、新しい推定量の線形結合の漸近正規性を確立すること。
  • 大規模な遺伝疫学研究(ボストン肺がん研究)を含む、シミュレーションおよび実データ応用を通じて手法を検証すること。

提案手法

  • 推定方程式のヘッセ行列を直接逆行列化することで、逆情報行列のスパarsity仮定を回避する洗練されたデバイアス付きlasso推定量を提案する。
  • ヘッセ行列に基づく補正を用いて、係数の任意の線形結合に対する漸近正規推定量を構築する。
  • モーメントの有界性およびスコア関数のリプシッツ連続性を含む正則性条件の下で、提案手法の漸近正規性を理論的に確立する。
  • 2次近似とスルツキーの定理を用いて、デバイアス付き推定量の漸近分布を導出し、有効な推論を保証する。
  • マルチプライヤーブートストラップまたは分散推定手順を用いて、適切なカバレッジを持つ信頼区間を構築する。
  • 「pが大きくnが小さい」および「nが大きくpが発散する」の両シナリオにおけるシミュレーションを通じて、手法を検証し、カバレッジ確率とバイアス低減を比較する。

実験結果

リサーチクエスチョン

  • RQ1標準的なデバイアス付きlassoは、高次元一般化線形モデルでなぜ十分にバイアスを除去できないのか?
  • RQ2GLMの文脈において、逆フィッシャー情報行列のスパarsity仮定は成り立つか? その仮定の違反は推論にどのように影響するか?
  • RQ3直接ヘッセ行列を逆行列化するデバイアス付き推定量は、バイアスと信頼区間カバレッジの面で、既存手法を上回ることができるか?
  • RQ4新しい推定量が漸近正規性および有効な推論を達成する理論的条件は何か?
  • RQ5提案手法は、ボストン肺がん研究のような実世界の高次元遺伝データにおいて、どのように性能を発揮するか?

主な発見

  • 標準的なデバイアス付きlassoは、変数の精密行列がスパースであっても、逆フィッシャー情報行列のスパarsity仮定がほとんど満たされないため、GLMsでは失敗する。
  • シミュレーションでは、既存のデバイアス付きlassoが「nが大きくpが発散する」設定において、名目水準よりも著しく低いカバレッジ確率の信頼区間を生成することが明らかになった。
  • 提案されたヘッセ行列に基づくデバイアス付き推定量は、シミュレーションにおいて顕著に改善された信頼区間カバレッジを達成し、名目水準に近づいた。
  • 新しい手法は推定バイアスを効果的に低減し、元のデバイアス付きlassoと比較してバイアス/標準誤差比が0にはるかに近づいた。
  • 理論的分析により、新しい推定量の線形結合の漸近正規性が確認され、有効な推論の基盤が確立された。
  • ボストン肺がん研究において、提案手法は肺がんリスクに及ぼす遺伝的要因の共同効果を信頼性のある推論で特定でき、実用的有用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。