Skip to main content
QUICK REVIEW

[논문 리뷰] A Scale-Free Approach for False Discovery Rate Control in Generalized Linear Models

Chenguang Dai, Buyu Lin|arXiv (Cornell University)|2020. 07. 02.
Statistical Methods and Inference참고 문헌 54인용 수 4
한 줄 요약

이 논문은 데이터 분할 또는 가우시안 미러링을 통해 두 개의 점점 더 독립적인 계수 추정치로부터 유도된 미러 통계량을 사용하여 일반화선형모형(GLMs)에서 가짜 발현률(FDR) 제어를 위한 척도 자유(scale-free) 프레임워크를 제안한다. 이 방법은 근본 가설 하에서 미러 통계량의 대칭적 표본 분포를 활용하여 FDR 제어를 보장하며, 점점 더 정규성에 의존하지 않는다는 점에서 중간 차원 및 고차원 설정 모두에서 벤자민-호크베르그와 노크오프 필터를 능가한다.

ABSTRACT

The Generalized Linear Model (GLM) has been widely used in practice to model counts or other types of non-Gaussian data. This article introduces a framework for feature selection in the GLM that can achieve robust False Discovery Rate (FDR) control. The main idea is to construct a <i>mirror statistic</i> based on data perturbation to measure the importance of each feature. FDR control is achieved by taking advantage of the mirror statistic’s property that its sampling distribution is (asymptotically) symmetric about zero for any null feature. In the moderate-dimensional setting, that is, p/n→κ∈(0,1), we construct the mirror statistic based on the maximum likelihood estimation. In the high-dimensional setting, that is, p≫n, we use the debiased Lasso to build the mirror statistic. The proposed methodology is scale-free as it only hinges on the symmetry of the mirror statistic, thus, can be more robust in finite-sample cases compared to existing methods. Both simulation results and a real data application show that the proposed methods are capable of controlling the FDR and are often more powerful than existing methods including the Benjamini-Hochberg procedure and the knockoff filter. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 특징 수 p가 표본 크기 n과 유사하거나 이를 초월할 때 GLMs에서의 특징 선택을 위한 강건한 FDR 제어 프레임워크를 개발하는 것.
  • 벤자민-호크베르그와 노크오프 필터와 같은 기존 방법들이 점점 더 정규성에 의존하고 고차원 환경에서 척도와 편향에 민감하다는 한계를 해결하는 것.
  • 모든 상수 배율에 대해 변하지 않는 척도 자유 성질을 갖추어 근본 가설 하에서 미러 통계량의 대칭성에만 의존함으로써 유한 표본 성능을 향상시키는 방법을 제공하는 것.
  • 최대우도추정법(MLE)과 비편향 라소를 각각 중간 차원(p/n → κ ∈ (0,1)) 및 고차원(p ≫ n) 설정에서 사용하여 이론적으로 FDR 제어를 확립하는 것.

제안 방법

  • 데이터 분할 또는 가우시안 미러 방법을 통해 두 개의 점점 더 독립적인 진짜 계수 추정치를 확보하고, 각 특징에 대해 이를 바탕으로 미러 통계량을 구성한다.
  • 근본 가설 하에서 미러 통계량의 표본 분포가 0을 중심으로 대칭적이라는 점을 활용하여 FDR 제어를 가능하게 한다.
  • 중간 차원 설정에서는 최대우도추정법(MLE)을 사용하여 계수를 추정하고, 분할된 데이터 또는 미러링된 데이터에서 쌍을 이룬 MLE를 기반으로 미러 통계량을 구성한다.
  • 고차원 설정에서는 계산의 실현 가능성을 유지하기 위해 분할된 데이터에서 비편향 라소를 사용하여 계수를 추정하고, 이를 기반으로 미러 통계량을 구성한다.
  • 데이터에 따라 변하는 임계값을 적용하여 임계값을 초과하는 미러 통계량을 가진 특징을 선택함으로써, 미약한 규칙성 및 희박성 조건 하에서 FDR 제어를 보장한다.
  • 척도 자유 성질을 활용: 미러 통계량의 모든 상수 배율에 영향을 받지 않아 유한 표본에서의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1가짜 발현률(FDR) 제어를 위한 척도 자유 프레임워크를 점점 더 정규성에 의존하지 않는 GLMs에 대해 개발할 수 있는가?
  • RQ2어떻게 하면 근본 가설 하에서 점점 더 대칭적인 분포를 갖는 미러 통계량을 구성하여 고차원 GLM 설정에서 강건한 FDR 제어를 달성할 수 있는가?
  • RQ3제안된 방법이 중간 차원 및 고차원 설정 모두에서 벤자민-호크베르그와 노크오프 필터보다 FDR 제어를 유지하고 더 높은 검정력을 확보하는가?
  • RQ4미러 통계량 프레임워크를 로지스틱 회귀를 초월하여 일반 공분산 구조 하에서 음이이항분포 및 포아송 모형을 포함한 GLMs로 확장할 수 있는가?
  • RQ5데이터 분할 및 가우시안 미러 방법이 p/n → κ ∈ (0,1)일 때 GLMs에서 점점 더 정규성에 의존하는 FDR 제어를 달성하는 이론적 조건은 무엇인가?

주요 결과

  • 제안된 방법은 MLE 기반의 미러 통계량을 사용하여 중간 차원 설정(p/n → κ ∈ (0,1))에서 점점 더 정규성에 의존하지 않는 점근적 FDR 제어를 달성하며, 고전적 MLE 점근 이론에서 악영향을 미치는 편향 및 분산 스케일링 요소의 지식이 필요하지 않다.
  • 고차원 설정(p ≫ n)에서는 비편향 라소 추정치를 사용하여 미러 통계량을 구성하고, 희박성 및 규칙성 조건 하에서 FDR 제어를 달성한다.
  • 시뮬레이션 결과는 다양한 GLM 가족(로지스틱, 음이이항분포, 선형 모형 포함)에서 명목 수준(FDR, 예: q=0.1)을 잘 유지함을 보여준다.
  • 이 방법은 특히 유한 표본 및 상관관계가 있는 설계 하에서 벤자민-호크베르그 절차와 노크오프 필터보다 통계적 검정력이 뛰어나게 일관되게 뛰어나다.
  • 실증 결과는 일정한 상관관계(일반 상관계수, 부분 상관계수, 토플리츠 구조)에 대해 안정적인 FDR 제어와 높은 검정력을 보이며, 다양한 설정에서 강건함을 입증한다.
  • 이 방법의 척도 자유 성질은 미러 통계량의 상수 배율에 영향을 받지 않아 실무에서 선택 결과의 신뢰성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.