Skip to main content
QUICK REVIEW

[論文レビュー] The Block Bootstrap Method for Longitudinal Microbiome Data

Pratheepa Jeganathan, Benjamin J. Callahan|arXiv (Cornell University)|Sep 6, 2018
Gut microbiota and health参考文献 38被引用数 7
ひとこと要約

本論文は、繰り返し観察の重複するブロックを再サンプリングすることで、被験者内時間的依存性を考慮し、縦断的マイクロバイオームデータに対する有効なノンパラメトリック推論を可能にする移動ブロックブートストラップ(MBB)手法を提案する。独立標本(PIS)や被験者別に統合する(MBS)手法と比較して、実用的なFDR閾値において、より高い真正陽性率とより低い偽陽性率を達成しており、複数のヒトマイクロバイオームデータセットにおける差分豊度分析の精度が向上していることが示された。

ABSTRACT

Microbial ecology serves as a foundation for a wide range of scientific and biomedical studies. Rapidly-evolving high-throughput sequencing technology enables the comprehensive search for microbial biomarkers using longitudinal experiments. Such experiments consist of repeated biological observations from each subject over time and are essential in accounting for the high between-subject and within-subject variability. Unfortunately, many of the statistical tests based on parametric models rely on correctly specifying temporal dependence structure which is unavailable in most microbiome data. In this paper, we propose an extension of the nonparametric bootstrap method that enables inference on these types longitudinal data. The proposed moving block bootstrap (MBB) method accounts for within-subject dependency by using overlapping blocks of repeated observations within each subject to draw valid inferences based on approximately pivotal statistics. Our simulation studies show an increase in power compared to merge-by-subject (MBS) strategies. We also show that compared to tests that presume independent samples (PIS), our proposed method reduces false microbial biomarker discovery rates. In this paper, we illustrated the MBB method using three different pregnancy data and an oral microbiome data. We provide an open-source R package https://github.com/PratheepaJ/bootLong to make our method accessible and the study in this paper reproducible.

研究の動機と目的

  • 被験者内時間的依存性を考慮した、縦断的マイクロバイオームデータにおける差分豊度検定のための堅牢な統計的手法の不足に対処すること。
  • 通常、マイクロバイオーム研究では未知であるがために、既知の時間的依存構造を必要とするパラメトリックモデルの制限を克服すること。
  • 被験者内相関を保持しながら統計的パワーを維持する、PISおよびMBS手法のノンパラメトリック代替手法を開発すること。
  • 不均一なシーケンシング深度およびバッチ効果を伴う高次元的でスパースかつ不均一分散なマイクロバイオームデータに適用可能な柔軟で計算的に実行可能な手法を提供すること。
  • オープンソースのRパッケージbootLongへの実装により、再現性とアクセス可能性を確保すること。

提案手法

  • 本手法は、各被験者内での繰り返し観察の重複するブロックを再サンプリングすることで、被験者内時間的依存性を保持する移動ブロックブートストラップ(MBB)を採用する。
  • バイアスと分散のバランスを最適化するために、サブサンプリングを用いてブロックサイズを選択する。
  • ピボット統計量(例:対数倍率変化)のサンプリング分布を再サンプリングにより推定し、差分豊度のためのp値を計算可能にする。
  • 多重検定における誤り発見率(FDR)を制御するため、Benjamini-Hochberg手順を用いて調整されたp値を計算する。
  • 技術的ノイズを低減し、推論の安定性を向上させるために、低豊度のASV(例:5–25%の閾値)を事前にフィルタリングする。
  • 本手法はオープンソースのRパッケージbootLongに実装されており、大規模データセットにおけるスケーラビリティを実現するための並列計算をサポートする。

実験結果

リサーチクエスチョン

  • RQ1特定のパラメトリック相関構造を仮定せずに、縦断的マイクロバイオームデータにおける被験者内時間的依存性を効果的にモデル化できるノンパラメトリックブートストラップ手法は存在するか?
  • RQ2実用的なFDR閾値において、MBB手法はPISおよびMBS手法と比較して、真正陽性率および偽陽性率の点でどのように異なるか?
  • RQ3スパースで高次元的なマイクロバイオームデータの差分豊度分析において、MBB手法は偽陽性を低減しながら統計的パワーを維持できるか?
  • RQ4MBB手法は、口腔内や膣マイクロバイオームにおける生物学的に妥当な株レベルの差異(例えば、時間的変動を示すもの)を、単純な統合や独立性仮定では捉えられないものとして検出できるか?
  • RQ5実際のマイクロバイオームデータセットにおける技術的変動(バッチ効果や不均一なシーケンシング深度など)に対して、本手法はどの程度頑健であるか?

主な発見

  • 実用的なFDRカットオフにおいて、MBB手法はPISおよびMBS手法よりも高い真正陽性率と低い偽陽性率を達成しており、優れた統計的性能が示された。
  • スタンフォード-AおよびUAB出産データセットにおいて、MBBはMBSよりもより多くの差分豊度を持つ微生物群を同定した。そのうち、生物学的に妥当な時間的ダイナミクスを示す株も含まれていた。
  • 口腔マイクロバイオームデータセットでは、MBBが43個の有意なASVを検出したが、MBSは12個にとどまり、そのうち39個は統合によって捉えられなかった低豊度株であった。
  • 本手法は、口腔マイクロバイオームにおけるVeillonellaおよびStreptococcus株の差異を、生物学的に妥当で技術的アーチファクトに起因しない時間的変動とともに検出できた。
  • サブサンプリングを用いたブロックサイズ選択により推論の正確性が向上し、事前フィルタリング(5–25%)により低豊度ASV由来のノイズを除去することで、より頑健な推論が実現した。
  • オープンソースのRパッケージbootLongにより、再現可能な解析が可能となり、並列計算をサポートすることで、大規模な縦断的マイクロバイオーム研究へのスケーラビリティが確保された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。