Skip to main content
QUICK REVIEW

[논문 리뷰] MCMC algorithms for Bayesian variable selection in the logistic regression model for large-scale genomic applications

Manuela Zucknick, Sylvia Richardson|arXiv (Cornell University)|2014. 02. 12.
Bayesian Methods and Mixture Models참고 문헌 20인용 수 5
한 줄 요약

이 논문은 고차원 로지스틱 회귀에서 베이지안 변수 선택을 위한 이웃 기반 MCMC 샘플러를 제안하며, 예측 변수 간의 조건부 의존 구조를 활용하여 혼합성과 수렴성을 향상시킨다. 상관관계가 높은 변수들을 함께 업데이트하기 위해 그룹화함으로써, 모델을 변경하지 않고도 대규모 유전체 적용에서 MCMC 샘플링을 크게 가속화한다. 시뮬레이션 및 실제 데이터 연구에서 표준 깁스 및 메트로폴리스-하스팅스 샘플러보다 우수한 성능을 보였다.

ABSTRACT

In large-scale genomic applications vast numbers of molecular features are scanned in order to find a small number of candidates which are linked to a particular disease or phenotype. This is a variable selection problem in the "large p, small n" paradigm where many more variables than samples are available. Additionally, a complex dependence structure is often observed among the markers/genes due to their joint involvement in biological processes and pathways. Bayesian variable selection methods that introduce sparseness through additional priors on the model size are well suited to the problem. However, the model space is very large and standard Markov chain Monte Carlo (MCMC) algorithms such as a Gibbs sampler sweeping over all p variables in each iteration are often computationally infeasible. We propose to employ the dependence structure in the data to decide which variables should always be updated together and which are nearly conditionally independent and hence do not need to be considered together. Here, we focus on binary classification applications. We follow the implementation of the Bayesian probit regression model by Albert and Chib (1993) and the Bayesian logistic regression model by Holmes and Held (2006) which both lead to marginal Gaussian distributions. We in- vestigate several MCMC samplers using the dependence structure in different ways. The mixing and convergence performances of the resulting Markov chains are evaluated and compared to standard samplers in two simulation studies and in an application to a real gene expression data set.

연구 동기 및 목표

  • p >> n 조건에서 표준 MCMC 샘플러의 계산 불가능성을 해결하기 위해.
  • 예측 변수 간의 조건부 의존 구조를 활용하여 MCMC 혼합성과 수렴성을 향상시키기 위해.
  • 모델에 대한 구조적 가정을 부과하지 않으면서도 사후 정확도를 유지하면서도 확장 가능한 히우리스틱 기반 MCMC 프레임워크를 개발하기 위해.
  • 이웃 기반 샘플러의 성능을 시뮬레이션 및 실제 유전자 발현 데이터에서 표준 깁스 및 메트로폴리스-하스팅스 방법과 비교하기 위해.
  • 효율적인 MCMC 샘플링을 통해 대규모 유전체 데이터 세트에 대한 베이지안 변수 선택의 실현 가능성을 입증하기 위해.

제안 방법

  • 쌍별 상관계수 또는 부분 상관계수를 기반으로 한 데이터 기반 이웃 구축을 통해 변수를 그룹화하고 함께 업데이트한다.
  • 홀름즈와 헬드(2006)의 데이터 보완 접근법을 적용하여 로지스틱 회귀를 조건부 정규 모형으로 변환함으로써 공액 사전을 가능하게 한다.
  • 전체 이웃의 변수를 동시에 업데이트하는 MCMC 샘플러를 구현하여 무작위로 비효율적인 단일 변수 제안을 줄인다.
  • 부분 상관계수 임계값을 사용하여 이웃을 정의함으로써 조건부 독립 구조를 포착하고 혼합성을 향상시킨다.
  • 이웃 샘플러를 평행 온도법 및 진화 몬테카를로와 조합하여 모형 공간 탐색 능력과 혼합성을 더욱 향상시킨다.
  • 다중 체인 간 수렴성과 체인 혼합성을 향상시키기 위해 기하학적 온도 래더를 평행 온도법에 적용한다.

실험 결과

연구 질문

  • RQ1이웃 기반 MCMC 샘플링은 고차원 로지스틱 회귀에서의 베이지안 변수 선택에 있어 혼합성과 수렴성을 향상시킬 수 있는가?
  • RQ2효용 샘플 크기와 계산 시간 측면에서 이웃 샘플러는 표준 전체 깁스 및 추가/삭제 메트로폴리스-하스팅스 샘플러와 비교해 어떻게 성능을 내는가?
  • RQ3이웃 정의에 원시 상관계수 대신 부분 상관계수를 사용할 경우 고차원 설정에서 더 나은 혼합성을 달성할 수 있는가?
  • RQ4모델에 대한 구조적 가정을 부과하지 않고도 히우리스틱 기반 이웃 구축이 MCMC 효율성을 얼마나 향상시킬 수 있는가?
  • RQ5제안된 방법은 실제 유전체 데이터 응용에서 평행 온도법 및 진화 몬테카를로와 효과적으로 조합될 수 있는가?

주요 결과

  • 부분 상관계수를 기반으로 한 이웃 샘플러는 시뮬레이션 시나리오 전반에서 전체 깁스 샘플링보다 우수했으며, 평균 이웃 크기가 중간에서 큰 경우에 특히 두드러졌다.
  • 시뮬레이션 시나리오 1에서, 상관계수 기반 이웃 샘플러는 이웃 크기가 충분히 클 경우 전체 깁스 성능을 맞추거나 초월했다.
  • 표준 전체 깁스 및 추가/삭제 메트로폴리스-하스팅스 샘플러와 비교해, 이웃 기반 MCMC 접근법은 반복당 혼합성이 빠르게 향상되었으며, 계산 시간 최적화 없이도 성능을 냈다.
  • 이 방법은 진짜 모형 구조에 대한 사전 지식 없이도 MCMC 효율성을 향상시켰으며, 오직 데이터 기반 의존 패턴에 의존했다.
  • 이웃 샘플러와 평행 온도법을 조합함으로써, p >> n 조건의 실제 유전자 발현 데이터 세트에서 수렴성과 탐색 능력이 크게 향상되었다.
  • 사전 분산의 선택인 c²가 γ의 사후 추정치에 미치는 영향이 미미하여, 기본 사전 설정 조건에서도 변수 선택에 대해 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.