Skip to main content
QUICK REVIEW

[論文レビュー] A Scale-Free Approach for False Discovery Rate Control in Generalized Linear Models

Chenguang Dai, Buyu Lin|arXiv (Cornell University)|Jul 2, 2020
Statistical Methods and Inference参考文献 54被引用数 4
ひとこと要約

本稿では、データ分割またはガウスミラーを用いて二つの漸近的に独立な係数推定値を取得することで得られるミラー統計を用いて、一般化線形モデル(GLMs)における誤発見率(FDR)制御のスケールフリーなフレームワークを提案する。この手法は、帰無仮説の下でミラー統計の対称的標本分布を利用することでFDR制御を実現し、漸近的正規性に依存せず、中程度次元および高次元設定の両方でBenjamini-Hochberg法やノックオフフィルターより優れた性能を発揮する。

ABSTRACT

The Generalized Linear Model (GLM) has been widely used in practice to model counts or other types of non-Gaussian data. This article introduces a framework for feature selection in the GLM that can achieve robust False Discovery Rate (FDR) control. The main idea is to construct a <i>mirror statistic</i> based on data perturbation to measure the importance of each feature. FDR control is achieved by taking advantage of the mirror statistic’s property that its sampling distribution is (asymptotically) symmetric about zero for any null feature. In the moderate-dimensional setting, that is, p/n→κ∈(0,1), we construct the mirror statistic based on the maximum likelihood estimation. In the high-dimensional setting, that is, p≫n, we use the debiased Lasso to build the mirror statistic. The proposed methodology is scale-free as it only hinges on the symmetry of the mirror statistic, thus, can be more robust in finite-sample cases compared to existing methods. Both simulation results and a real data application show that the proposed methods are capable of controlling the FDR and are often more powerful than existing methods including the Benjamini-Hochberg procedure and the knockoff filter. Supplementary materials for this article are available online.

研究の動機と目的

  • 特徴数pが標本サイズnと同等またはそれ以上である状況におけるGLMsにおける特徴選択のための頑健なFDR制御フレームワークの構築。
  • Benjamini-Hochberg法やノックオフフィルターような既存手法の限界、特に漸近的正規性に依存し、スケーリングやバイアスに敏感である点の是正。
  • スケールフリー性を備え、帰無仮説の下でのミラー統計の対称性のみに依存することで、有限標本における性能を向上。
  • 最尤推定(MLE)とデバイアスドLassoをそれぞれ用いて、中程度次元(p/n → κ ∈ (0,1))および高次元(p ≫ n)設定において理論的FDR制御を確立。

提案手法

  • データ分割またはガウスミラー法により得られる、真の係数の二つの漸近的に独立な推定値を用いて、各特徴に対してミラー統計を構築する。
  • 帰無仮説の下でミラー統計の標本分布がゼロの周りに対称的であることを利用し、FDR制御を可能にする。
  • 中程度次元設定では、最尤推定(MLE)を用いて係数を推定し、分割データまたはミラーデータ上のペアドMLEからミラー統計を構築する。
  • 高次元設定では、デバイアスドLassoを用いて係数を推定し、分割データからのミラー統計を構築することで計算可能性を維持する。
  • データに依存するしきい値を適用し、しきい値を超えるミラー統計を持つ特徴を選択することで、ややいびつな正則性およびスパarsity条件の下でFDR制御を保証する。
  • スケールフリー性を活用:ミラー統計の任意の定数倍によるスケーリングは選択結果に影響を及ぼさないため、有限標本における頑健性が向上する。

実験結果

リサーチクエスチョン

  • RQ1漸近的正規性に依存しない、GLMsにおけるスケールフリーなFDR制御フレームワークを構築できるか?
  • RQ2ミラー統計をどのように構築すれば、帰無仮説の下で漸近的に対称的となり、高次元GLM設定において頑健なFDR制御が可能になるか?
  • RQ3提案手法は、中程度次元および高次元設定の両方において、Benjamini-Hochberg法やノックオフフィルターよりもFDR制御を維持し、より高い検出力を持つのか?
  • RQ4ミラー統計フレームワークは、ロジスティック回帰を越えて、一般の共分散構造を有する負の二項分布やポisson回帰などのGLMsに拡張可能か?
  • RQ5データ分割法およびガウスミラー法が、p/n → κ ∈ (0,1) となるGLMsにおいて、漸近的FDR制御を達成する理論的条件は何か?

主な発見

  • 提案手法は、MLEに基づくミラー統計を用いて中程度次元設定(p/n → κ ∈ (0,1))において漸近的FDR制御を達成し、古典的MLEの漸近論で問題となるバイアスおよび分散のスケーリング要因の知識を必要としない。
  • 高次元設定(p ≫ n)では、デバイアスドLasso推定値を用いてミラー統計を構築し、スパarsityおよび正則性条件の下でFDR制御を達成する。
  • シミュレーション結果から、ロジスティック回帰、負の二項分布、線形モデルを含むさまざまなGLM族において、名目水準(例:q=0.1)でFDRが制御されていることが示された。
  • この手法は、有限標本および相関構造のある設計のもとで、Benjamini-Hochberg手順およびノックオフフィルターと比較して一貫して高い検出力を示した。
  • 実験的結果から、定数対の相関、部分相関、トーペリッツ型相関構造に対してもFDR制御が安定し、多様な設定で高い検出力を示した。
  • スケールフリー性のおかげで、ミラー統計の定数倍によるスケーリングに依存しない選択結果が得られ、実務における信頼性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。