Skip to main content
QUICK REVIEW

[논문 리뷰] Modular Bayes screening for high-dimensional predictors

Yuhan Chen, David B. Dunson|arXiv (Cornell University)|2017. 03. 29.
Bayesian Methods and Mixture Models참고 문헌 21인용 수 4
한 줄 요약

이 논문은 고차원 예측 변수를 위한 베이지안 비모수 걸러내기 방법인 MOBS(Modular Bayes Screening)를 소개한다. MOBS는 예측 변수별 효과와 응답 분포의 주변 분포 모델링을 분리하기 위해 모듈화 기법을 사용한다. 응답에 디리클레 과정 혼합 모델을 적용하고 각 예측 변수에 대해 사후 포함 확률을 조건부로 계산함으로써, 테스트 간 정보를 공유하면서도 불확실성의 과소평가를 방지한다. 3800만 개의 SNP를 포함한 cis-eQTL 데이터셋에서 평균 차이를 초월한 복잡한 분포 이동을 탐지하는 데 기존 방법들보다 뛰어난 성능을 보였다.

ABSTRACT

With the routine collection of massive-dimensional predictors in many application areas, screening methods that rapidly identify a small subset of promising predictors have become commonplace. We propose a new MOdular Bayes Screening (MOBS) approach, which involves several novel characteristics that can potentially lead to improved performance. MOBS first applies a Bayesian mixture model to the marginal distribution of the response, obtaining posterior samples of mixture weights, cluster-specific parameters, and cluster allocations for each subject. Hypothesis tests are then introduced, corresponding to whether or not to include a given predictor, with posterior probabilities for each hypothesis available analytically conditionally on unknowns sampled in the first stage and tuning parameters controlling borrowing of information across tests. By marginalizing over the first stage posterior samples, we avoid under-estimation of uncertainty typical of two-stage methods. We greatly simplify the model specification and reduce computational complexity by using {\em modularization}. We provide basic theoretical support for this approach, and illustrate excellent performance relative to competitors in simulation studies and the ability to capture complex shifts beyond simple differences in means. The method is illustrated with applications to genomics by using a very high-dimensional cis-eQTL dataset with roughly 38 million SNPs.

연구 동기 및 목표

  • 강한 파라미터적 가정에 의존하거나 테스트 간 정보 공유에 실패하는 기존 고차원 걸러내기 방법의 한계를 해결하기 위해.
  • 두 단계 추정의 함정을 피하면서도 불확실성 정량화를 유지하는 가용성과 계산 효율성이 높은 걸러내기 방법을 개발하기 위해.
  • 비모수 베이지안 모델을 사용해 단순한 평균 차이를 초월한 복잡한 분포 이동을 탐지할 수 있도록, 초대규모 p 소형 n 설정에서의 적용을 가능하게 하기 위해.
  • 범주형, 연속형, 복잡한 오브제트 데이터 유형을 포함한 다양한 데이터 유형에 적용 가능한 탄력적인 프레임워크를 제공하기 위해.

제안 방법

  • MOBS는 모듈화된 베이지안 접근법을 사용하며, 먼저 응답 y의 주변 분포에 디리클레 과정 혼합 모델을 적합하여 혼합 가중치, 클러스터 파라미터, 클러스터 할당의 사후 표본을 확보한다.
  • 이 사후 표본에 조건부로, 각 예측 변수에 대한 변수 포함 사후 확률을 계산한다. 이때 계층적 사전 분포 구조를 사용하여 테스트 간 정보 공유를 가능하게 한다.
  • 첫 번째 단계의 사후 표본을 통합하여 불확실성의 극복을 도모함으로써, 두 단계 절차에서 흔히 발생하는 분산 과소평가를 방지한다.
  • 응답 모델과 예측 변수 모델을 분리하기 위해 모듈화를 사용함으로써, 고차원 설정에서 계산의 타당성과 강건성을 향상시킨다.
  • 연속형 또는 혼합 예측 변수의 경우, 고정점 기반 이산화와 커널 보간법을 적용하여 조건부 밀도 f(y|x_j)를 추정한다.
  • 기본 응답 모델에 적합한 MCMC 알고리즘이 존재하는 한, 다변량 및 복잡한 결과 유형으로의 확장도 가능하다.

실험 결과

연구 질문

  • RQ1강한 파라미터적 가정 없이도 테스트 간 정보를 공유함으로써 고차원 설정에서 걸러내기 성능을 향상시킬 수 있는 모듈화된 베이지안 비모수 접근법이 가능한가?
  • RQ2MOBS는 평균 차이를 초월한 복잡한 분포 이동을 탐지하는 데 기존 걸러내기 방법과 비교해 어떤가?
  • RQ3MOBS는 두 단계 방법에서 흔히 발생하는 분산 과소평가를 어느 정도 방지하면서도 불확실성 정량화를 유지하는가?
  • RQ4MOBS는 약 3800만 개의 SNP를 포함한 초고차원 게놈 데이터, 예를 들어 cis-eQTL 데이터셋에서 생물학적으로 관련된 SNP를 효과적으로 식별할 수 있는가?

주요 결과

  • MOBS는 DCS(1.88), SIS(1.91), SIRS(1.86), JYL(1.64)보다 총 절대 평균 거리가 훨씬 낮은 1.12를 기록하여, 평균 차이를 초월한 복잡한 분포 이동을 잘 포착함을 시사한다.
  • 50개 SNP로 구성된 부분집합에서의 예측 성능 평가에서, MOBS-L은 평균 MSE 0.850을 기록했으며, SIS-L(0.880), DCS-L(0.882), SIRS-L(0.886), FUSEDK-L(0.847), JYL-L(0.852)와 비교해 유사하거나 더 우수한 성능을 보였다.
  • MOBS는 SIS, DCS, SIRS가 주로 평균 이동을 탐지하는 데 반해, 주로 다른 세트의 SNP를 선택하여, 새로운 복잡한 효과를 탐지할 수 있음을 입증했다.
  • MOBS는 약 3800만 개의 SNP를 포함한 cis-eQTL 데이터셋을 성공적으로 처리하여 초고차원 설정에서의 확장성을 입증했다.
  • 모의 실험과 실제 데이터에서 MOBS는 비모수 기반 이동 탐지 능력이 향상되었고, 계산 효율성과 불확실성 캘리브레이션을 유지하면서도 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.