Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Mean-Covariance Estimation via the Horseshoe with an Application in Genomic Data Analysis

Yunfan Li, Jyotishka Datta|arXiv (Cornell University)|2019. 03. 15.
Gene expression and cancer classification참고 문헌 31인용 수 5
한 줄 요약

이 논문은 고차원적 유사로직 회귀 모델에 대해 허시우 및 그래픽 허시우 사전을 사용하여 완전 베이지안 공동 평균-공분산 추정 방법을 제안하며, 예측 변수의 수에 대해 선형 시간 샘플링을 가능하게 한다. 이 방법은 동시에 회귀 계수와 정밀도 행렬 원소를 수축시키면서도 희박성과 불확실성 측정을 유지함으로써, eQTL 분석에서 뛰어난 추정 및 예측 성능을 달성한다.

ABSTRACT

Seemingly unrelated regression is a natural framework for regressing multiple correlated responses on multiple predictors. The model is very flexible, with multiple linear regression and covariance selection models being special cases. However, its practical deployment in genomic data analysis under a Bayesian framework is limited due to both statistical and computational challenges. The statistical challenge is that one needs to infer both the mean vector and the inverse covariance matrix, a problem inherently more complex than separately estimating each. The computational challenge is due to the dimensionality of the parameter space that routinely exceeds the sample size. We propose the use of horseshoe priors on both the mean vector and the inverse covariance matrix. This prior has demonstrated excellent performance when estimating a mean vector or inverse covariance matrix separately. The current work shows these advantages are also present when addressing both simultaneously. A full Bayesian treatment is proposed, with a sampling algorithm that is linear in the number of predictors. MATLAB code implementing the algorithm is freely available from github at https://github.com/liyf1988/HS_GHS. Extensive performance comparisons are provided with both frequentist and Bayesian alternatives, and both estimation and prediction performances are verified on a genomic data set.

연구 동기 및 목표

  • 고차원 게놈 데이터에서 베이지안 프레임워크 내에서 공동 평균 및 공분산 추정의 통계적 및 계산적 과제를 해결하기 위해.
  • 유사로직 회귀(SUR)에서 희박한 회귀 계수와 희박한 정밀도 행렬을 동시에 추정할 수 있는 확장 가능한 완전 베이지안 방법을 개발하기 위해.
  • 기존의 베이지안 방법이 예측 변수-반응 관계에 제한적인 가정을 요구하거나 확장성에 빈도가 떨어지는 점을 극복하기 위해.
  • 완전한 게비스 샘플러를 통해 불확실성 측정과 자동 튜닝을 가능하게 하며, 예측 변수의 수에 대해 선형 복잡도를 갖는다.

제안 방법

  • 고차원 평균 추정에서 희박성과 수축을 유도하기 위해 회귀 계수에 허시우 사전을 적용한다.
  • 정밀도 행렬의 희박성과 조건부 인적성 구조 모델링을 위해 공분산의 역행렬에 그래픽 허시우 사전을 적용한다.
  • 평균 및 공분산 매개변수의 공동 추정을 위해 두 사전을 통합한 통합 HS-GHS(Horseshoe-Graphical Horseshoe) 사전을 구성한다.
  • 예측 변수의 수에 대해 선형 스케일링, 반응 수에 대해 세제곱 스케일링을 보이는 완전한 게비스 샘플링 알고리즘을 개발하여 효율적인 사후 탐색을 가능하게 한다.
  • 평균과 정밀도 행렬에 대한 공액 샘플링 단계를 촉진하기 위해 공동 추정 문제를 분리하는 재매개변수화 전략을 사용한다.
  • 알고리즘을 MATLAB로 구현하고 GitHub에 공개하여 재현성과 게놈 분야 응용을 위해 제공한다.

실험 결과

연구 질문

  • RQ1고차원 eQTL 분석에서 별도 또는 빈도주의 방법과 비교해 볼 때, 완전 베이지안 공동 추정 프레임워크가 평균 및 공분산 매개변수에 대해 뛰어난 성능을 달성할 수 있는가?
  • RQ2HS-GHS 사전이 평균 및 정밀도 행렬 추정에 공동으로 사용될 경우, 최소 최대성 및 최적 Kullback–Leibler 위험 등의 유리한 이론적 성질을 유지하는가?
  • RQ3제안된 게비스 샘플러는 예측 변수의 수가 증가함에 따라 효율적으로 확장되며, 고차원 설정에서 정확한 사후 추론을 유지할 수 있는가?
  • RQ4평균 및 공분산의 공동 모델링은 각각의 반응을 별도로 모델링하는 것보다 추정 및 예측 정확도를 어떻게 향상시키는가?
  • RQ5허시우 사전의 글로벌-로컬 구조는 eQTL 맵핑에서 불확실성 측정과 거짓 발견 제어에 어떤 영향을 미치는가?

주요 결과

  • 제안된 HS-GHS 방법은 예측 변수의 수에 대해 선형 계산 복잡도를 보이며, 고차원 게놈 데이터에 대해 확장 가능하다.
  • 실제 eQTL 데이터셋에서 기존의 빈도주의 및 베이지안 경쟁자들과 비교해 본 결과, 이 방법은 진정한 희박한 연관성을 식별하는 데 특히 뛰어난 추정 및 예측 성능을 보였다.
  • 완전한 베이지안 프레임워크는 사후 캘리브레이션을 통해 좋은 빈도주의 커버리지 성능을 보이며, 불확실성 측정에 유리하다.
  • 평균에 대한 허시우 사전과 정밀도 행렬에 대한 그래픽 허시우 사전이 함께 희박성을 유지하고 유전자 발현 데이터의 복잡한 의존성 구조에 적응한다.
  • 이론적 분석을 통해 HS-GHS 사후의 사후 집중률이 로그 인자까지 최적임을 확인하여, 고차원 설정에서의 일致성에 대한 근거를 제공한다.
  • 실증적 비교 결과, 모든 예측 변수가 모든 반응에 영향을 주거나 전혀 영향을 주지 않는다고 가정하는 기존의 베이지안 방법보다, 이 방법은 임의의 희박성 패턴을 허용함으로써 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.