Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian biclustering for microbial metagenomic sequencing data via multinomial matrix factorization

Fangting Zhou, Kejun He|arXiv (Cornell University)|2020. 05. 17.
Gut microbiota and health참고 문헌 20인용 수 4
한 줄 요약

이 논문은 조성성, 희소성, 과분산을 고려하여 메타게놈 데이터에서 미생물과 숙주를 동시에 클러스터링할 수 있는 베이지안 다항분포 행렬 분해 모델을 제안한다. 이 모델은 계통발생적 인디언버거프로세스(pIBP) 사전분포를 사용하여 계통수 계층 구조를 잠재 클러스터 구조에 통합한다. 실험 결과, 염증성 장질환(IBD)과 관련된 생물학적으로 의미 있는 겹치는 미생물 군집을 성공적으로 식별하였으며, 기존에 알려진 가족인 Bacteroidaceae와 Enterobacteriaceae 등을 포함한다. 특히 계통수 트리 통합을 통해 클러스터의 생물학적 해석 가능성이 향상되었다.

ABSTRACT

High-throughput sequencing technology provides unprecedented opportunities to quantitatively explore human gut microbiome and its relation to diseases. Microbiome data are compositional, sparse, noisy, and heterogeneous, which pose serious challenges for statistical modeling. We propose an identifiable Bayesian multinomial matrix factorization model to infer overlapping clusters on both microbes and hosts. The proposed method represents the observed over-dispersed zero-inflated count matrix as Dirichlet-multinomial mixtures on which latent cluster structures are built hierarchically. Under the Bayesian framework, the number of clusters is automatically determined and available information from a taxonomic rank tree of microbes is naturally incorporated, which greatly improves the interpretability of our findings. We demonstrate the utility of the proposed approach by comparing to alternative methods in simulations. An application to a human gut microbiome dataset involving patients with inflammatory bowel disease reveals interesting clusters, which contain bacteria families Bacteroidaceae, Bifidobacteriaceae, Enterobacteriaceae, Fusobacteriaceae, Lachnospiraceae, Ruminococcaceae, Pasteurellaceae, and Porphyromonadaceae that are known to be related to the inflammatory bowel disease and its subtypes according to biological literature. Our findings can help generate potential hypotheses for future investigation of the heterogeneity of the human gut microbiome.

연구 동기 및 목표

  • 통계적 모델링에서 조성성, 희소성, 이질성, 노이즈 등에 기인한 마이크로바이옴 데이터의 과제를 해결하기 위해.
  • 동시에 겹치는 미생물 및 숙주 클러스터를 식별할 수 있는 공동 클러스터링 프레임워크를 개발하기 위해.
  • 유전적 계통수 계층 정보를 통합하여 추론된 클러스터의 생물학적 해석 가능성을 향상시키기 위해.
  • 계층적 베이지안 모델 하에서 자동 클러스터 수 결정과 완전한 사후분포 추론을 가능하게 하기 위해.
  • 염증성 장질환(IBD) 환자에서 질병 연관 미생물 군집을 더 잘 탐지하기 위해.

제안 방법

  • 과분산과 제로 과잉을 고려하기 위해 마이크로바이옴 카운트 데이터를 딜리클-다항분포 혼합모형으로 모델링한다.
  • 잠재 클러스터 구조에 계통수 관계를 통합하기 위해 계통발생적 인디언버거프로세스(pIBP) 사전분포를 사용한다.
  • 겹치는 구성원을 허용하는 동시에 미생물 및 숙주 클러스터를 공동으로 추론하기 위해 계층적 베이지안 프레임워크를 적용한다.
  • 관측된 카운트 행렬을 잠재 이진 지표 Z를 통해 표현하기 위해 희소 행렬 분해 기법을 적용한다.
  • 개개인의 숙주에 따라 다를 수 있는 클러스터 할당을 허용하기 위해 개별 인덱스 i, j에 대한 특수 파라미터 s_ij와 t_ij를 도입한다.
  • 모든 사후분포 추론을 위해 MCMC 기법을 사용하여 불확실성 정량화와 확률적 클러스터 특성화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1베이지안 다항분포 행렬 분해 모델은 메타게놈 시퀀싱 데이터의 조성성과 제로 과잉 성질을 효과적으로 다룰 수 있는가?
  • RQ2계통수 트리 정보를 통합할 경우, 마이크로바이옴 데이터에서 이클러스터의 생물학적 해석 가능성은 어떻게 향상되는가?
  • RQ3황금 표준이 없는 상황에서 사전지식의 영향은 클러스터 발견 정확도와 재현 가능성에 어떤 영향을 미치는가?
  • RQ4사전 설정 없이도 모델이 최적의 겹치는 클러스터 수를 자동으로 결정할 수 있는가?
  • RQ5제안된 방법은 IBD 연관 미생물 군집 탐지에서 기존 대안 방법보다 우수한 성능을 보이는가?

주요 결과

  • 모델은 IBD 데이터셋에서 네 개의 구분 가능한 이클러스터를 성공적으로 식별하였으며, 그 중 한 클러스터는 염증성 장질환 환자에서 높은 빈도로 관찰되었다.
  • 모델은 Bacteroidaceae, Bifidobacteriaceae, Enterobacteriaceae, Fusobacteriaceae, Lachnospiraceae, Ruminococcaceae, Pasteurellaceae, Porphyromonadaceae 등 기존에 알려진 IBD 연관 세균 가족을 탐지하였다.
  • 계통수 트리 정보 통합은 클러스터의 해석 가능성 향상에 중대한 영향을 미쳤으며, 트리 구조 하에서 추론된 행렬의 로그 확률이 높아서 (-91.48 대비 -119.95) 이를 입증하였다.
  • 트리 사전분포 없이 적용한 경우, 모델은 IBD 연관 클러스터를 식별하지 못했고, 클러스터 내 계통수 일관성 또한 낮았다.
  • 제안된 모델의 잠재 할당 행렬 Z의 사후 평균이 다른 사전분포 및 결정론적 임계값 대비 실제 농도 패턴을 가장 잘 반영하였다.
  • 모의 실험과 실제 데이터 분석 모두에서 모델은 특히 사전지식을 활용한 경우 생물학적으로 의미 있는 클러스터를 회복하는 데 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.