Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Structural Learning with Parametric Marginals for Count Data: An Application to Microbiota Systems

Veronica Vinciotti, Pariya Behrouzi|arXiv (Cornell University)|2022. 03. 18.
Bayesian Methods and Mixture Models인용 수 5
한 줄 요약

이 논문은 마이크로바이옴 시퀀싱 데이터와 같이 고차원적이고 이질적인 카운트 데이터에서의 종속 구조를 추론하기 위해, 비모수적 이산 Weibull 모수 확률분포를 갖는 베이지안 가우시안 코프룰라 그래픽 모델을 제안한다. 모수적 이산 Weibull 모수 확률분포를 사용하여 변량 효과를 모수적으로 모델링하고, 연속시간 출생-사망 탐색과 확장된 순위우도를 활용함으로써, 완전한 불확실성 정량화를 통한 동시에 모수 효과와 네트워크 구조의 추론이 가능해지며, 생물학적으로 관련성이 있는 미생물 상호작용을 탐지하는 데 있어 기존 표준 방법들을 능가한다.

ABSTRACT

High dimensional and heterogeneous count data are collected in various applied fields. In this paper, we look closely at high-resolution sequencing data on the microbiome, which have enabled researchers to study the genomes of entire microbial communities. Revealing the underlying interactions between these communities is of vital importance to learn how microbes influence human health. To perform structural learning from multivariate count data such as these, we develop a novel Gaussian copula graphical model with two key elements. Firstly, we employ parametric regression to characterize the marginal distributions. This step is crucial for accommodating the impact of external covariates. Neglecting this adjustment could potentially introduce distortions in the inference of the underlying network of dependences. Secondly, we advance a Bayesian structure learning framework, based on a computationally efficient search algorithm that is suited to high dimensionality. The approach returns simultaneous inference of the marginal effects and of the dependence structure, including graph uncertainty estimates. A simulation study and a real data analysis of microbiome data highlight the applicability of the proposed approach at inferring networks from multivariate count data in general, and its relevance to microbiome analyses in particular. The proposed method is implemented in the R package BDgraph.

연구 동기 및 목표

  • 마이크로바이옴 연구에서 흔히 나타나는 고차원적이고 이질적인 카운트 데이터에서의 구조학습 과제를 해결하기 위해.
  • 외부 변량을 모수적 분포에 통합하여 임의의 종속성을 줄이고 네트워크 복원 정확도를 향상시키기 위해.
  • 모수 효과와 그래프 구조 양쪽 모두의 불확실성을 고려한 계산적으로 효율적인 베이지안 프레임워크를 개발하기 위해.
  • 소화기 및 구강 마이크로바이옴과 같은 복잡한 시스템에서의 미생물 상호작용을 정확히 추론하기 위해.
  • 과잉 제로와 과분산을 보이는 카운트 데이터에 대한 비모수적 또는 변환 기반 접근법의 영구적이고 유연한 대안을 제공하기 위해.

제안 방법

  • 조건부 독립성 그래프에 모수적 비정규 종속성 모델링을 가능하게 하기 위해 가우시안 코프룰라를 사용하여 모수적 분포를 연결한다.
  • 이차적 위치 및 산란 효과를 변량으로부터 동시에 포괄할 수 있도록 이산 Weibull 회귀를 사용하여 모수적 분포를 모델링한다.
  • 이산 데이터에서의 비단조화성 문제를 다루기 위해 확장된 순위우도를 적용하여 잠재 가우시안 공간에서 일관된 추정이 가능하게 한다.
  • 고차원 설정에서 효율적인 베이지안 네트워크 구조 학습을 위해 연속시간 출생-사망 과정을 활용한다.
  • 그래프 구조와 부분 상관관계에 대한 전체 사후 분포 추론을 통합하여, 사후 엣지 확률을 통한 불확실성 추정을 포함한다.
  • 실제 마이크로바이옴 데이터에 대한 접근성을 높이기 위해 R 패키지 BDgraph에 이 방법을 구현한다.

실험 결과

연구 질문

  • RQ1모수적 모수 분포를 갖는 베이지안 코프룰라 그래픽 모델이 기존 표준 방법 대비 고차원 카운트 데이터에서 네트워크 추론 성능을 향상시키는가?
  • RQ2모수 분포에 변량을 통합할 경우, 추론된 미생물 상호작용 네트워크의 정확도와 강건성에 어떤 영향을 미치는가?
  • RQ3이산 Weibull 모수 분포를 사용할 경우, 마이크로바이옴 카운트 데이터의 이질성과 과분산/저분산을 얼마나 잘 포괄하는가?
  • RQ4고차원 설정에서 그래프 구조와 엣지 강도의 불확실성을 얼마나 잘 정량화하는가?
  • RQ5소화기 및 구강 마이크로바이옴 시스템에서 추론된 네트워크 구조로부터 어떤 생물학적 통찰을 도출할 수 있는가?

주요 결과

  • 이 방법은 생물학적으로 타당한 미생물 상호작용 네트워크를 성공적으로 복원하였으며, 소화기 및 타액 마이크로바이옴 그룹 내에서의 연결성이 그들 사이보다 더 강했다.
  • 소화기에서 평균 사후 엣지 확률은 4.7%였고, 타액에서는 10%였으며, 각각 89%와 87%의 엣지가 사후 확률이 0.5 초과였다.
  • 그룹 간 연결성 역시 유의미했으며, 86%의 엣지가 사후 확률 0.5 초과였고, 평균 절대 부분 상관계수는 0.17이었으며, 이는 소화기와 구강 마이크로바이옴 간의 기능적 상호작용을 시사했다.
  • 이산 Weibull 모수 분포에 변량을 포함시킴으로써 임의의 종속성이 감소하고 네트워크 추정 정확도가 향상되었다.
  • 베이지안 프레임워크는 완전한 불확실성 정량화를 제공하였으며, 사후 엣지 확률과 부분 상관계수 추정치를 통해 고차원 설정에서 강력한 추론이 가능했다.
  • 이 방법은 염증성 장질환, 비만, 제2형 당뇨병과 관련된 프로피오박터스-바이오틱스 상호작용을 탐지하여 잠재적 치료 타겟을 제시했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.