Skip to main content
QUICK REVIEW

[논문 리뷰] Solving the Empirical Bayes Normal Means Problem with Correlated Noise

Lei Sun, Matthew Stephens|arXiv (Cornell University)|2018. 12. 18.
Statistical Methods in Clinical Trials참고 문헌 62인용 수 9
한 줄 요약

이 논문은 상관된 잡음 하에서 정규 평균 문제에 대한 새로운 경험적 베이즈 접근법을 개발한다. 이는 Schwartzman(2010)의 헤르미트 다항식을 사용한 상관된 표준 정규분포의 경험적 분포 표현을 활용한다. 표준 정규분포와 그 도함수들의 기저를 통해 잡음 분포를 모델링함으로써, 사전분포와 잡음 분포를 동시에 추정할 수 있으며, 이는 강한 상관관계가 존재하는 상황에서도 정확한 수축과 FDR 제어를 가능하게 한다. 시뮬레이션 결과에서 기존의 표준 EB 방법보다 뛰어난 성능을 보였다.

ABSTRACT

The Normal Means problem plays a fundamental role in many areas of modern high-dimensional statistics, both in theory and practice. And the Empirical Bayes (EB) approach to solving this problem has been shown to be highly effective, again both in theory and practice. However, almost all EB treatments of the Normal Means problem assume that the observations are independent. In practice correlations are ubiquitous in real-world applications, and these correlations can grossly distort EB estimates. Here, exploiting theory from Schwartzman (2010), we develop new EB methods for solving the Normal Means problem that take account of unknown correlations among observations. We provide practical software implementations of these methods, and illustrate them in the context of large-scale multiple testing problems and False Discovery Rate (FDR) control. In realistic numerical experiments our methods compare favorably with other commonly-used multiple testing methods.

연구 동기 및 목표

  • 기존 경험적 베이즈 방법이 관측치가 상호 독립임을 전제로 하여 실세계 데이터에서 널리 퍼져 있는 상관관계를 간과하는 이론적 한계를 해결하고자 한다.
  • 알 수 없는 상관관계를 고려한 이론적으로 타당하고 실용적인 방법을 개발하여 고차원 정규 위치 문제에서 잡음 항 간의 상관관계를 반영하고자 한다.
  • 상관관계로 인해 왜곡되는 표준 EB 추정치가 존재하는 다중 검정 상황에서 후행 평균 추정의 정확성과 FDR 제어의 정확성을 향상시키고자 한다.
  • 유전자체계 및 기타 고차원 환경에서의 실제 적용을 위해 R 패키지 cashr를 통해 계산적으로 실현 가능한 구현을 제공하고자 한다.

제안 방법

  • Schwartzman(2010)의 표현을 활용하여 상관된 표준 정규변수의 경험적 분포를 헤르미트 다항식과 그 도함수들의 급수 전개로 모델링한다.
  • 잡음 벡터 Z의 교환가능성을 가정하고, 한계 경험적 분포 F_p를 φ(x)와 그 도함수 φ^{(l-1)}(x)의 기저로 모델링하며, 상관 모멘트 ρ̄^l으로 가중한다.
  • g를 척도 혼합 정규분포(적응형 수축)로 가정하여, 두 단계 EB 절차를 통해 사전분포 g(θ)와 잡음 분포 F_p를 동시에 추정한다.
  • 경험적 분포함수 F_p의 기저 전개를 통해 표준 정규누적분포함수 Φ(x)에서 유래된 상관관계에 의한 왜곡을 포착한다.
  • Mehler의 항등식과 이元정규분포의 공동 누적분포함수를 사용하여 F_p의 공분산 구조를 유도함으로써, 경험적 분포에 대한 상관관계 효과를 추정할 수 있다.
  • R 패키지 cashr를 통해 구현하여, 대규모 다중 검정 문제에서 상관 잡음 하에서도 확장 가능한 추정과 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1관측치 간의 알려지지 않은 상관관계가 정규 평균 문제에서 표준 경험적 베이즈 추정치에 어떤 영향을 미치는가?
  • RQ2헤르미트 함수와 그 도함수들의 기저를 사용하여 상관된 표준 정규변수의 경험적 분포를 정확하게 표현할 수 있는가?
  • RQ3수축과 FDR 제어에 대한 상관관계에 의한 편향을 보정하기 위해 사전분포와 잡음 분포의 공동 추정을 어떻게 수립할 수 있는가?
  • RQ4제안된 방법이 상관된 검정 통계량이 존재하는 다중 검정 상황에서 FDR 추정과 검정력에 얼마나 기여하는가?

주요 결과

  • 비중요한 상관관계가 존재할 경우, 특히 고차 모멘트에 대해 평균 상관관계 ρ̄^l가 0이 아닐 경우, 상관된 표준 정규변수의 경험적 분포 F_p는 표준 정규누적분포함수 Φ(x)와 상당한 차이를 보인다.
  • F_p의 분산과 공분산은 ∑ₗ ρ̄^l [φ^{(l-1)}(x)/√l!]² 형태의 항에 의해 지배되며, 이는 강한 상관관계 하에서도 0이 되지 않아 표준 EB 방법에서의 i.i.d. 가정을 무너뜨린다.
  • 모의실험을 통해 강한 상관관계 하에서도 진짜 사전분포 g(θ)를 성공적으로 복원함을 입증하였다.
  • 대규모 다중 검정 시뮬레이션에서, 상관 잡음 하에서 표준 EB 및 Benjamini-Hochberg 절차에 비해 FDR 제어가 향상되고 더 높은 통계적 검정력을 확보하였다.
  • R 패키지 cashr를 통해 실제 데이터에 대한 적용이 가능하며, 유전자체계 데이터셋 유사한 데이터에서 알려지지 않은 상관관계 구조에 대해 강건한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.