Skip to main content
QUICK REVIEW

[論文レビュー] Phylogenetic Dirichlet-multinomial model for microbiome data

Yunfan Tang, Li Ma|arXiv (Cornell University)|Oct 27, 2016
Bayesian Methods and Mixture Models参考文献 30被引用数 3
ひとこと要約

本稿では、系統的関係を組み込むことで微生物群集構成解析を改善する、系統的ディリクレート・多項分布(PhyloDM)モデルを提案する。内部の系統樹ノードで局所的ディリクレート・多項分布をモデル化し、スキャン統計量を用いて系統特異的な差を検出することで、従来のDMモデルと比較して顕著に高いモデル適合度と統計的検出力が得られることを、アメリカン・ガットデータセットを用いて示した。

ABSTRACT

In this paper we introduce the phylogenetic Dirichlet-multinomial (PhyloDM) model for investigating cross-group differences in microbiome compositions. Traditional Dirichlet-Multinomial (DM) models ignore species relatedness, leading to loss in efficiency and to results that are difficult to interpret. PhyloDM solves these issues by replacing the global model with a cascade of independent local DMs on the internal nodes of the phylogenetic tree. Each of the local DMs captures the count distributions of a certain number of operational taxonomic units (OTU) at a given resolution. Since distributional differences tend to occur in clusters along evolutionary lineages, we design a scan statistic over the phylogenetic tree to allow nodes to borrow signal strength from their parents and children. We also derive a formula to bound the tail probability of the scan statistic, and verify its accuracy through simulations. The PhyloDM model is applied to the American Gut dataset to identify taxa associated with diet habits. Empirical studies performed on this dataset show that PhyloDM achieves a significantly better fit, and has higher testing power than DM.

研究の動機と目的

  • 従来のディリクレート・多項分布(DM)モデルが微生物群集研究において系統的関係を無視しているという限界を是正すること。
  • 系統的に情報を持つ形で微生物構成の差をモデル化することで、統計的効率性と解釈可能性を向上させること。
  • 系統樹における関連するノード同士で強度を共有することで、系統特異的な構成変化を高感度に検出する手法を開発すること。
  • 系統特異的変化を検出するために使用するスキャン統計量の尾確率に対して、有界な理論的境界を提供すること。

提案手法

  • 系統樹の内部ノードにおける独立な局所的DMモデルの連鎖に、グローバルなディリクレート・多項分布モデルを置き換える。
  • 系統的解像度に基づいて、操作的分類単位(OTUs)をノードに割り当てる。各ノードは関連する税目のグループを表す。
  • 親ノードと子ノードからの信号を集約することで、系統に沿って差異が顕著な微生物群集のクラスタを検出するスキャン統計量を用いる。
  • スキャン統計量の尾確率に対する理論的境界を導出し、多重検定における第一種の過誤を制御する。
  • 食事パターンに関連する微生物群集を同定するために、アメリカン・ガットデータセットにモデルを適用する。
  • 広範なシミュレーションと標準的なDMモデルとの実証的比較を通じて、手法の正確性と性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1従来のディリクレート・多項分布モデルと比較して、微生物群集構成モデリングに系統的関係を組み込むことで、統計的検出力とモデル適合度が向上するか?
  • RQ2宿主要因(例:食事)に関連する微生物群集の構成差は、進化的な系統に沿ってクラスタリングする傾向があるか?
  • RQ3系統樹における関連する微生物群集から、信号強度を効果的に共有することで、差異が顕著な微生物群集を高感度に検出する方法は何か?
  • RQ4系統特異的変化を検出するために使用するスキャン統計量の尾確率に対する適切な統計的境界は何か?

主な発見

  • PhyloDMは、標準的なディリクレート・多項分布モデルと比較して、アメリカン・ガットデータセットへの適合度が顕著に優れていた。
  • 従来のDMモデルと比較して、食事関連の微生物群集を検出する際の検出力が高かった。
  • スキャン統計量の尾確率に対する導出された境界は、シミュレーション研究を通じて正確であることが確認された。
  • 実証的結果から、食事習慣に関連する構成差は、特定の進化的系統に沿ってクラスタリングされやすいことが示された。
  • 系統樹のノードで局所的DMモデルを用いることで、より解釈可能で進化的に整合性のある微生物群集差の検出が可能になった。
  • スキャン統計量は、親ノードと子ノード間の階層的関係を活用することで、系統レベルの信号を効果的に捉えていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。