Skip to main content
QUICK REVIEW

[논문 리뷰] The Block Bootstrap Method for Longitudinal Microbiome Data

Pratheepa Jeganathan, Benjamin J. Callahan|arXiv (Cornell University)|2018. 09. 06.
Gut microbiota and health참고 문헌 38인용 수 7
한 줄 요약

이 논문은 종단적 마이크로바이옴 데이터에 대해 유효한 비모수적 추론를 가능하게 하기 위해 이동 블록 부트스트랩(Moving Block Bootstrap, MBB) 방법을 제안한다. 이는 반복 관찰치의 겹치는 블록을 재표본 추출하여 내부 주체 간 시간적 의존성을 고려한다. 독립 표본(PIS) 또는 주제별 병합(MBS) 방법과 비교할 때, MBB는 실용적인 FDR 임계값에서 더 높은 참 양성률과 더 낮은 참 음성률을 기록하여, 다양한 인간 마이크로바이옴 데이터셋에서 차등 존재 분석의 정확도가 향상됨을 보여준다.

ABSTRACT

Microbial ecology serves as a foundation for a wide range of scientific and biomedical studies. Rapidly-evolving high-throughput sequencing technology enables the comprehensive search for microbial biomarkers using longitudinal experiments. Such experiments consist of repeated biological observations from each subject over time and are essential in accounting for the high between-subject and within-subject variability. Unfortunately, many of the statistical tests based on parametric models rely on correctly specifying temporal dependence structure which is unavailable in most microbiome data. In this paper, we propose an extension of the nonparametric bootstrap method that enables inference on these types longitudinal data. The proposed moving block bootstrap (MBB) method accounts for within-subject dependency by using overlapping blocks of repeated observations within each subject to draw valid inferences based on approximately pivotal statistics. Our simulation studies show an increase in power compared to merge-by-subject (MBS) strategies. We also show that compared to tests that presume independent samples (PIS), our proposed method reduces false microbial biomarker discovery rates. In this paper, we illustrated the MBB method using three different pregnancy data and an oral microbiome data. We provide an open-source R package https://github.com/PratheepaJ/bootLong to make our method accessible and the study in this paper reproducible.

연구 동기 및 목표

  • 내부 주체 간 시간적 의존성을 고려하지 않는 종단적 마이크로바이옴 데이터에 대한 강력한 통계적 방법의 부족을 해결하기 위해.
  • 일반적으로 마이크로바이옴 연구에서 알려져 있지 않은 시간적 의존성 구조를 요구하는 파라미터 모델의 제한을 극복하기 위해.
  • PIS 및 MBS 방법의 비모수적 대안을 개발하여 내부 주체 상관관계를 유지하면서도 통계적 검정력을 유지하기 위해.
  • 불균형한 시퀀싱 깊이와 배치 효과를 동반한 고차원적, 희박하고 이질적인 분산을 보이는 마이크로바이옴 데이터에 적용 가능한 유연하고 계산적으로 실현 가능한 방법을 제공하기 위해.
  • 오픈소스 R 패키지 bootLong을 구현하여 재현 가능성과 접근성을 확보하기 위해.

제안 방법

  • 이 방법은 각 주체 내 반복 관찰치의 겹치는 블록을 재표본 추출하여 내부 주체 간 시간적 의존성을 유지하는 이동 블록 부트스트랩(Moving Block Bootstrap, MBB)을 사용한다.
  • 블록 크기는 부표본 추출을 통해 부트스트랩 분포의 편향과 분산의 균형을 최적화하기 위해 선택된다.
  • 중심 통계량(예: 로그 배수 변화)의 표본 분포는 재표본 추출을 통해 추정되며, 이는 차등 존재 분석을 위한 p-값 계산을 가능하게 한다.
  • 다중 검정에서 잘못된 발견률(FDR)을 통제하기 위해 Benjamini-Hochberg 절차를 사용하여 조정된 p-값을 계산한다.
  • 기술적 노이즈를 줄이고 추론의 안정성을 향상시키기 위해 저발현 ASV(예: 5–25% 임계값)를 제거하기 위해 사전 필터링을 적용한다.
  • 이 방법은 오픈소스 R 패키지 bootLong에 구현되어 있으며, 대규모 데이터셋에서의 확장성을 위해 병렬 컴퓨팅을 지원한다.

실험 결과

연구 질문

  • RQ1특정 파라미터적 상관관계 구조를 가정하지 않고도 비모수적 부트스트랩 방법이 종단적 마이크로바이옴 데이터의 내부 주체 간 시간적 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2실용적인 FDR 임계값에서 MBB 방법은 PIS 및 MBS 방법과 비교해 참 양성률과 참 음성률 측면에서 어떻게 성능을 발휘하는가?
  • RQ3희박하고 고차원적인 마이크로바이옴 데이터의 차등 존재 분석에서 MBB 방법은 참 양성률을 유지하면서도 참 음성률을 감소시키는가?
  • RQ4MBB 방법은 간단한 병합 또는 독립성 가정을 위반하는 경우 놓칠 수 있는 생물학적으로 의미 있는 병원체 수준의 차이(예: 구강 또는 자궁경부 마이크로바이옴에서의 차이)를 감지할 수 있는가?
  • RQ5실제 마이크로바이옴 데이터셋에서 배치 효과와 불균형한 시퀀싱 깊이와 같은 기술적 변동성에 대해 이 방법은 어느 정도 강건한가?

주요 결과

  • 실용적인 FDR 절단값에서 MBB 방법은 PIS 및 MBS 방법보다 더 높은 참 양성률과 더 낮은 참 음성률을 기록하여 향상된 통계적 성능을 보였다.
  • 스탠퍼드-A 및 UAB 임신 데이터셋에서 MBB는 MBS보다 더 많은 차등 존재하는 분류군을 식별했으며, 생물학적으로 타당한 시간적 동역학을 보이는 병원체를 포함했다.
  • 구강 마이크로바이옴 데이터셋에서는 MBB가 MBS의 12개보다 43개의 유의미한 ASV를 감지했으며, 이 중 39개는 병합으로는 포착되지 않은 저발현 병원체였다.
  • 이 방법은 Veillonella 및 Streptococcus 병원체와 같은 구강 마이크로바이옴에서의 병원체 수준의 차이를 성공적으로 감지했으며, 이는 생물학적으로 타당하고 기술적 오염원으로 인한 것이 아닌 시간적 변동성을 보였다.
  • 부표본 기반 블록 크기 선택이 추론 정확도를 향상시켰으며, 사전 필터링(5–25%)이 저발현 ASV에서 유래하는 노이즈를 제거하여 강건성을 향상시켰다.
  • 오픈소스 R 패키지 bootLong은 재현 가능한 분석을 가능하게 하며 병렬 컴퓨팅을 지원하여 대규모 종단적 마이크로바이옴 연구에 대한 확장성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.