Skip to main content
QUICK REVIEW

[논문 리뷰] False Discovery Rate Control Under General Dependence By Symmetrized Data Aggregation

Lilun Du, Xu Guo|arXiv (Cornell University)|2020. 02. 27.
Statistical Methods in Clinical Trials참고 문헌 61인용 수 6
한 줄 요약

이 논문은 일반적 의존성 하에서 FDR 제어를 위한 분포무관 다중검정 절차인 대칭화된 자료집합(Symmetrized Data Aggregation, SDA)을 제안한다. 샘플 분할, 자료 선별, 정보 융합을 활용함으로써 SDA는 대칭적인 순위 통계량과 데이터 기반 임계값을 구성하여, 기존의 노크오프나 BH와 같은 방법들보다 더 강건한 FDR 제어와 뛰어난 검정력 확보를 가능하게 한다. 특히 중간에서 강한 의존성 하에서 유의미한 성능 향상을 보인다.

ABSTRACT

We develop a new class of distribution-free multiple testing rules for false discovery rate (FDR) control under general dependence. A key element in our proposal is a symmetrized data aggregation (SDA) approach to incorporating the dependence structure via sample splitting, data screening, and information pooling. The proposed SDA filter first constructs a sequence of ranking statistics that fulfill global symmetry properties, and then chooses a data-driven threshold along the ranking to control the FDR. The SDA filter substantially outperforms the Knockoff method in power under moderate to strong dependence, and is more robust than existing methods based on asymptotic <i>p</i>-values. We first develop finite-sample theories to provide an upper bound for the actual FDR under general dependence, and then establish the asymptotic validity of SDA for both the FDR and false discovery proportion control under mild regularity conditions. The procedure is implemented in the R package sdafilter. Numerical results confirm the effectiveness and robustness of SDA in FDR control and show that it achieves substantial power gain over existing methods in many settings.

연구 동기 및 목표

  • 일반적 의존성 구조 하에서 강건하고 분포무관인 FDR 제어 방법을 개발한다.
  • 독립성 가정이나 渐近적 근사에 의존하는 기존 FDR 절차(예: BH 및 노크오프)의 한계를 해결한다.
  • 비모수적이고 데이터 기반의 접근을 통해 의존성 정보를 통합함으로써 강력한 파rametric 가정 없이도 통계적 검정력을 향상시킨다.
  • 약간의 규칙성 조건 하에서 유한표본 및 점근적 이론적 보장을 확립하여 FDR과 거짓 발견 비율(FDP) 제어를 가능하게 한다.
  • 유전체 및 고차원 설정에서의 실제 응용을 위한 R 패키지 sdafilter를 통한 실용적 구현을 제공한다.

제안 방법

  • 샘플 분할을 통해 자료를 학습 및 검증 세트로 나누어, 양측 분할에서 테스트 통계량의 대칭성을 확보한다.
  • 양측 분할의 테스트 통계량을 평균하여 대칭화된 순위 통계량을 구성함으로써 전역적인 대칭성 특성을 확보하고 강건성을 향상시킨다.
  • 정보 융합 이전에 약한 신호를 선별하고 노이즈를 감소시키기 위해 자료 선별을 적용한다.
  • 다중 분할 간의 정보 융합을 통해 신호 대 노이즈 비율을 향상시키고 FDR 추정의 안정성을 높인다.
  • 대칭화된 통계량의 순위를 따라 데이터 기반 임계값을 선택하여 명목 수준에서 FDR을 제어한다.
  • 점근적 정규성이나 파rametric 모델에 의존하지 않도록 거짓 발견 비율(FDP)의 비모수적 추정을 사용한다.

실험 결과

연구 질문

  • RQ1독립성 가정이나 점근적 정규성 없이도 일반적 의존성 하에서 FDR 제어가 가능할 수 있는가?
  • RQ2의존성 구조는 다중검정에서 통계적 검정력을 향상시키기 위해 어떻게 효과적으로 활용될 수 있는가?
  • RQ3유한표본에서 의존성 하의 FDR 제어 행동은 어떠한가? 엄밀한 경계를 설정할 수 있는가?
  • RQ4중간에서 강한 의존성 하에서 SDA 절차가 노크오프 및 BH 절차에 비해 검정력과 강건성 측면에서 어떻게 비교되는가?
  • RQ5비모수적이고 데이터 기반 접근이 약간의 규칙성 조건 하에서 점근적으로 FDR 및 FDP 제어에 유효성을 확보할 수 있는가?

주요 결과

  • SDA 필터는 임의의 의존성 하에서도 유한표본에서 FDR 제어를 달성하며, 중간 편차 이론을 통해 실제 FDR의 상한선이 확립되었다.
  • 특히 고차원 설정에서 중간에서 강한 의존성 하에서 SDA는 노크오프 방법에 비해 유의미하게 높은 검정력을 확보하였다.
  • 반복적 샘플 분할을 사용하는 R-SDA 버전은 단일 분할 SDA에 비해 FDP 및 AP 추정의 변동성이 낮고, 더 안정된 성능을 보였다.
  • 표본 크기와 검정 수가 변할 때에도 SDA는 공분산 행렬 추정이 이루어지는 경우에도 정확한 FDR 제어를 유지하였으며, 소표본 영역에서 PFA 및 DATE보다 뛰어난 성능을 보였다.
  • 실제 B 계열 ALL 유전자 발현 데이터 분석에서 SDA는 BH, SS, PFA, DATE보다 더 높은 일관성과 검정력을 확보하여 19개의 차별적 발현 프로브 세트를 식별하였다.
  • 수치 결과는 SDA가 정규성 위반 및 모형 오설정에 대해 강건하며, 의존성 구조가 어떻게 되든 FDR 제어가 명목 수준에 근접하게 유지됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.