Skip to main content
QUICK REVIEW

[논문 리뷰] False Discovery Rate Control via Data Splitting

Chenguang Dai, Buyu Lin|arXiv (Cornell University)|2020. 02. 20.
Statistical Methods and Inference참고 문헌 64인용 수 8
한 줄 요약

이 논문은 고차원 특성 선택에서 가짜 발현률(FDR) 제어를 위한 데이터 분할 프레임워크를 제안하며, 귀무가설 하에서 대칭성을 보장하기 위해 회귀 계수의 독립적 추정치를 사용한다. 다중 데이터 분할(MDS)은 선택의 안정성을 높이고 검정력(power)을 향상시키며, FDR의 분산을 감소시켜 선형 및 가우시안 그래픽 모델에서 최소한의 분포 가정으로 점점 더 FDR 제어를 달성한다.

ABSTRACT

Selecting relevant features associated with a given response variable is an important problem in many scientific fields. Quantifying quality and uncertainty of a selection result via false discovery rate (FDR) control has been of recent interest. This article introduces a data-splitting method (referred to as “DS”) to asymptotically control the FDR while maintaining a high power. For each feature, DS constructs a test statistic by estimating two independent regression coefficients via data splitting. FDR control is achieved by taking advantage of the statistic’s property that, for any null feature, its sampling distribution is symmetric about zero; whereas for a relevant feature, its sampling distribution has a positive mean. Furthermore, a Multiple Data Splitting (MDS) method is proposed to stabilize the selection result and boost the power. Surprisingly, with the FDR under control, MDS not only helps overcome the power loss caused by data splitting, but also results in a lower variance of the false discovery proportion (FDP) compared with all other methods in consideration. Extensive simulation studies and a real-data application show that the proposed methods are robust to the unknown distribution of features, easy to implement and computationally efficient, and are often the most powerful ones among competitors especially when the signals are weak and correlations or partial correlations among features are high. Supplementary materials for this article are available online.

연구 동기 및 목표

  • 특성 분포에 대한 최소한의 가정으로 고차원 특성 선택에서 가짜 발현률(FDR)을 제어하는 데 도전하는 것.
  • 고차원 추론에서 데이터 분할과 관련된 전형적인 검정력 손실을 해결하는 것.
  • 높은 상관관계와 약한 신호 조건에서도 높은 통계적 검정력을 유지하는 강건하고 계산 효율적인 FDR 제어 방법을 개발하는 것.
  • 특성의 연합 분포가 알려져 있거나 복잡한 설정으로의 FDR 제어를 확장하는 것.
  • 표준 고차원 회귀 도구를 사용해 쉽게 구현할 수 있고, 특성의 진짜 조건부 분포에 대한 지식이 필요 없는 프레임워크를 제공하는 것.

제안 방법

  • 데이터를 두 개의 독립된 부분으로 나누며, 하나는 특성 선택(예: Lasso를 통한)이고, 다른 하나는 검정 통계량 추정(예: 나머지 데이터에서의 OLS)을 위한 것이다.
  • 각 특성에 대해, 별도의 데이터 분할에서 얻은 두 개의 독립적 회귀 계수 추정치의 차이를 검정 통계량으로 계산한다.
  • 귀무가설 하에서 검정 통계량의 표본 분포가 대칭적임(즉, 귀무가설 특성의 경우 0을 중심으로 대칭됨)을 활용하여 FDR 제어를 가능하게 한다.
  • 다중 데이터 분할(MDS)을 구현하기 위해 데이터 분할 및 선택 과정을 여러 번 반복하고 결과를 집계하여 선택의 안정성과 검정력을 향상시킨다.
  • 집계된 검정 통계량에 대해 벤자민-호크비어 프로시저(BHq)를 적용하여 사전 설정된 수준에서 FDR을 제어한다.
  • 귀무가설 하에서 계수 추정치의 점근적 정규성과 독립성을 기반으로 이론적 FDR 제어를 확보한다.

실험 결과

연구 질문

  • RQ1데이터 분할 전략을 사용하여 고차원 선형 및 가우시안 그래픽 모델에서 점점 더 FDR을 점근적으로 제어할 수 있는가?
  • RQ2다중 데이터 분할(MDS)은 단일 분할 방법에 비해 가짜 발현 비율(FDP)의 분산을 감소시키는가?
  • RQ3약한 신호와 높은 상관관계 조건에서 제안된 방법이 높은 검정력을 유지할 수 있는가?
  • RQ4특성의 연합 분포가 알려져 있거나 잘못 지정된 경우 실무에서 이 방법은 어떻게 성능을 보이는가?
  • RQ5이 프레임워크는 비선형 모델이나 영상, 자연어와 같은 복잡한 데이터 유형으로 확장될 수 있는가?

주요 결과

  • 제안된 데이터 분할 방법은 선형 및 가우시안 그래픽 모델에서 저차원과 고차원 모두에서 임의의 지정된 수준에서 점근적으로 FDR을 제어한다.
  • MDS는 단일 분할 방법과 콘드로프 필터링을 포함한 모든 다른 방법에 비해 가짜 발현 비율(FDP)의 분산을 크게 감소시킨다.
  • MDS는 특히 높은 상관관계와 약한 신호 조건에서 검정력을 향상시켜 BHq, 콘드로프 필터링, DeepPINK보다 여러 시뮬레이션 및 실데이터 설정에서 뛰어난 성능을 보였다.
  • 실제 HIV 약물 내성 연구에서 MDS는 7개의 PI 약물 중 5개와 6개의 NRTI 약물 중 4개에서 경쟁자들보다 더 많은 진짜 돌연변이를 발견했으며, DDI와 TDF와 같은 약물에서는 특히 뛰어난 성능을 보였다.
  • 이 방법은 알려지지 않은 특성 분포에 대해 강건하며, 모델-X 콘드로프 필터링과 달리 특성 연합 분포에 대한 지식이 필요하지 않다.
  • 이 프레임워크는 계산적으로 효율적이며 표준 고차원 회귀 소프트웨어를 사용해 쉽게 구현할 수 있어 실무 적용에 접근성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.