Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Bayesian Variable Selection for Structured High-dimensional Data

Changgee Chang, Suprateek Kundu|arXiv (Cornell University)|2016. 04. 25.
Statistical Methods and Inference참고 문헌 28인용 수 5
한 줄 요약

이 논문은 알려진 그래프에 구조화된 고차원 데이터를 위한 확장 가능한 베이지안 변수 선택 방법을 제안한다. 이 방법은 그래프 정규화된 초모수를 가진 라플라스 사전분포를 통해 적응형 수축을 구현한다. 이 방법은 p ~ 100,000까지의 계산 확장성을 확보하는 효율적인 EM 알고리즘을 사용하며, 고정 및 증가하는 차원 모두에서 강력한 예측 성능, 변수 선택 능력, 이론적 일致성을 보여준다. 이는 그래프가 잘못 지정된 경우에도 성립한다.

ABSTRACT

Variable selection for structured covariates lying on an underlying known graph is a problem motivated by practical applications, and has been a topic of increasing interest. However, most of the existing methods may not be scalable to high dimensional settings involving tens of thousands of variables lying on known pathways such as the case in genomics studies. We propose an adaptive Bayesian shrinkage approach which incorporates prior network information by smoothing the shrinkage parameters for connected variables in the graph, so that the corresponding coefficients have a similar degree of shrinkage. We fit our model via a computationally efficient expectation maximization algorithm which scalable to high dimensional settings (p~100,000). Theoretical properties for fixed as well as increasing dimensions are established, even when the number of variables increases faster than the sample size. We demonstrate the advantages of our approach in terms of variable selection, prediction, and computational scalability via a simulation study, and apply the method to a cancer genomics study.

연구 동기 및 목표

  • 유전체학에서의 유전자 경로와 같이 알려진 그래프에 구조화된 예측 변수를 가진 고차원 데이터에서 변수 선택 문제를 해결하기 위해.
  • 연결된 변수들에 대해 유사한 수축을 장려함으로써 네트워크 정보를 통합하는 베이지안 접근법을 개발하여 변수 선택 및 예측 성능을 향상시키기 위해.
  • 100,000개의 변수를 가진 데이터셋에 대해 계산 확장성을 확보하여 MCMC 기반의 베이지안 방법의 한계를 극복하기 위해.
  • 고정 및 발산하는 차원 모두에서 오라클성 및 선택 일치성과 같은 이론적 성질을 확립하기 위해.
  • 그래프가 잘못 지정된 경우에도 예측 정확도가 높고 거짓 양성률이 낮은 강건한 성능을 보여주기 위해.

제안 방법

  • 등급 수축 매개변수에 대한 초모수에 그래프 구조를 반영한 로그정규 분포를 가진 역공분산 행렬을 사용하여 회귀 계수에 라플라스 사전분포를 적용한다.
  • 수축 매개변수의 역공분산 행렬은 그래프 라플라시안으로 모델링되어 연결된 변수들에 대한 수축을 부드럽게 하고, 연결되지 않은 변수들 사이의 조건부 독립성을 보장한다.
  • EM 알고리즘은 역공분산 행렬을 누락 데이터로 간주하여 관측 데이터에 대한 닫힌 형태의 후행분포를 도출함으로써 효율적인 계산을 가능하게 한다.
  • 고차원 환경에서의 계산 효율성을 향상시키기 위해 동적 가중 lasso 기법을 통합한다.
  • 기존의 적응형 lasso와 달리 초기 가중치에 의존하지 않으며, MCMC 기반 대안보다 계산적으로 더 효율적이다.
  • 일般적인 가정 하에 이론적 성질이 입증되었으며, 진짜 그래프가 잘못 지정된 경우에도 오라클성 및 선택 일치성이 유지된다.

실험 결과

연구 질문

  • RQ1p ~ 100,000인 고차원 회귀에서 그래프 구조화된 사전 정보를 효과적으로 통합할 수 있는 베이지안 변수 선택 방법이 존재하는가?
  • RQ2제안된 방법이 고차원 환경에서 기존의 빈도주의 및 베이지안 방법보다 더 나은 예측 및 변수 선택 성능을 달성하는가?
  • RQ3변수 수가 표본 크기를 초과하고 그래프가 잘못 지정된 경우에도 이 방법이 계산 확장성과 이론적 일치성을 유지할 수 있는가?
  • RQ4실제 유전체학 데이터에서 그래프 정보 통합이 거짓 양성률과 생물학적 해석 가능성에 어떤 영향을 미치는가?
  • RQ5그래프 정규화된 초모수를 통한 적응형 수축은 표준 수축 방법에 비해 추정 정확도를 얼마나 향상시키는가?

주요 결과

  • 시뮬레이션 결과, 제안된 EMSHS 방법은 가장 낮은 교차검증 평균제곱예측오차(CV MSPE = 0.975)를 기록했으며, 조정 파rameter당 단지 17.0초의 시간으로 가장 계산 효율적이었다.
  • EMSHS는 예측 정확도와 계산 속도에서 EMVS 및 EMVSS를 모두 앞섰으며, 각각 CV MSPE 0.975, 0.996, 0.982를 기록했다.
  • TCGA 암 유전체학 응용에서 EMSHS는 100번의 무작위 분할 동안 최소한 한 번 이상 21개의 유전자를 선택했으며, TOM1L1, RANBP17, BRD7가 가장 자주 선택된 유전자였다.
  • 선택된 유전자들 중 Wnt 신호전달 경로가 뚜렷하게 enrich되어 있었으며, TOM1L1, RANBP17, BRD7에 대한 추정 계수는 각각 -0.146, 0.181, 0.193로 암에서 알려진 기능과 일치했다.
  • 시뮬레이션 시나리오 1, 2, 5에서 EMSHS는 EMSH보다 더 낮은 거짓 양성률을 보였으며, 그래프 정보가 정확히 통합되었을 때 특이도가 향상됨을 시사했다.
  • 이론적 결과는 고정 및 증가하는 차원 모두에서 선택 일치성 및 오라클 성질이 유지됨을 확인했으며, 진짜 그래프가 잘못 지정된 경우에도 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.