Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering microbiome data using mixtures of logistic normal multinomial models

Yuan Fang, Sanjeena Subedi|arXiv (Cornell University)|2020. 11. 12.
Bayesian Methods and Mixture Models참고 문헌 58인용 수 4
한 줄 요약

이 논문은 상대적 풍부도를 추가 대수비율(ald) 변환을 통해 실수 유클리드 공간으로 매핑하고 잠재 변수의 후행분포를 가우시안 분포로 근사함으로써, 계산 비용을 줄이는 변분 가우시안 근사(VGA)를 사용한 혼합 로지스틱 정규 다항분포 모델을 이용한 마이크로바이옴 조성 데이터에 대한 모형 기반 클러스터링 방법을 제안한다. 이 방법은 MCMC에 비해 계산 부담을 감소시켜 시뮬레이션 및 실제 데이터셋(페레티 구강 마이크로바이옴 및 시 데이터셋 포함)에서 정확한 클러스터링을 가능하게 한다.

ABSTRACT

Discrete data such as counts of microbiome taxa resulting from next-generation sequencing are routinely encountered in bioinformatics. Taxa count data in microbiome studies are typically high-dimensional, over-dispersed, and can only reveal relative abundance therefore being treated as compositional. Analyzing compositional data presents many challenges because they are restricted on a simplex. In a logistic normal multinomial model, the relative abundance is mapped from a simplex to a latent variable that exists on the real Euclidean space using the additive log-ratio transformation. While a logistic normal multinomial approach brings in flexibility for modeling the data, it comes with a heavy computational cost as the parameter estimation typically relies on Bayesian techniques. In this paper, we develop a novel mixture of logistic normal multinomial models for clustering microbiome data. Additionally, we utilize an efficient framework for parameter estimation using variational Gaussian approximations (VGA). Adopting a variational Gaussian approximation for the posterior of the latent variable reduces the computational overhead substantially. The proposed method is illustrated on simulated and real datasets.

연구 동기 및 목표

  • 고차원적이고 과분산된, 조성적 마이크로바이옴 카운트 데이터의 클러스터링 도전 과제를 해결하기 위해.
  • 특히 파arameter 추정에 MCMC를 사용할 경우 계산 비용이 높은 로지스틱 정규 다항분포 모델에서의 베이지안 추론의 고비용 문제를 해결하기 위해.
  • 마이크로바이옴 데이터의 조성적 성격을 유지하는 확장 가능한 모형 기반 클러스터링 프레임워크를 개발하기 위해.
  • 변분 근사를 통해 고차원 환경에서의 효율적 추정 및 클러스터링을 가능하게 하기 위해.
  • 알려진 그룹 구조를 가진 실제 및 시뮬레이션 데이터셋에서의 방법 성능을 입증하기 위해.

제안 방법

  • 단순형 제약 조건이 있는 데이터를 실수 유클리드 공간으로 매핑하기 위해 상대적 풍부도를 추가 대수비율 변환을 사용하여 로지스틱 정규 다항분포로 모델링한다.
  • 마이크로바이옴 데이터의 잠재적 클러스터 구조를 포착하기 위해 유한한 혼합 로지스틱 정규 다항분포 모델을 사용한다.
  • 잠재 변수의 후행분포를 근사하기 위해 변분 가우시안 근사(VGA)를 사용하여 계산 비용이 높은 MCMC 샘플링을 대체한다.
  • 클러스터 할당을 추정하고 VGA를 통해 모델 파라미터를 갱신하는 반복을 반복하는 일반화된 기대최대화(GEM) 알고리즘을 구현한다.
  • 차별적으로 풍부한 분류군을 식별하고 차원을 줄이며 조성적 무결성을 유지하기 위해 ALDEx2를 사용하여 기능 선택을 수행한다.
  • 고차원 설정에서 정규화를 고려하여 잠재 공간에서의 공분산 행렬의 역행렬을 이용해 분류군 간의 의존성을 모델링한다.

실험 결과

연구 질문

  • RQ1혼합 로지스틱 정규 다항분포 모델이 마이크로바이옴 데이터의 진짜 잠재 클러스터 구조를 효과적으로 복원할 수 있는가?
  • RQ2제안된 변분 가우시안 근사 방법이 MCMC 기반 추론에 비해 계산 효율성과 클러스터링 정확도 측면에서 어떻게 비교되는가?
  • RQ3기능 선택(예: ALDEx2 또는 상위 풍부도 분류군)이 저차원 및 고차원 설정에서 클러스터링 성능에 어떤 영향을 미치는가?
  • RQ4알려진 생물학적 그룹이 있는 실제 마이크로바이옴 데이터셋에서 이 방법의 성능은 얼마나 우수한가?
  • RQ5이 모델은 회귀 확장 방법을 통해 환경적 또는 생물학적 공변량을 통합할 수 있는가?

주요 결과

  • 제안된 방법은 시뮬레이션 데이터에서 높은 클러스터링 정확도를 달성하였으며, 파라미터 복원이 진짜 값에 매우 가까워 안정성과 일관성을 입증하였다.
  • 페레티 구강 마이크로바이옴 데이터셋에서 가장 차별적으로 풍부한 분류군을 사용하여 조정된 랜드 지수(ARI) 0.85를 달성하였으며, 가장 풍부한 분류군만을 사용한 모델에 비해 유의미하게 뛰어난 성능을 보였다.
  • 시 데이터셋에서는 이원 모델이 ARI 0.05를 기록하였고, 48개 샘플 중 18개가 잘못 분류되어 낮은 샘플 수 설정에서 중간 수준의 성능을 보였다.
  • atlas1006 데이터셋에서는 ARI가 0.002로 나타나 이 데이터셋에는 클러스터링 신호가 거의 없거나 매우 높은 복잡성을 지닌 것으로 나타났다.
  • ALDEx2를 통해 차별적으로 풍부한 분류군을 사용한 결과, 단지 가장 풍부한 분류군만을 사용한 경우보다 훨씬 뛰어난 클러스터링 성능을 보였으며, 기능 선택의 중요성을 강조하였다.
  • 변분 가우시안 근사 프레임워크는 MCMC에 비해 계산 비용을 크게 감소시켜 고차원 마이크로바이옴 데이터에 대한 확장성을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.