Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Structural Learning with Parametric Marginals for Count Data: An Application to Microbiota Systems

Veronica Vinciotti, Pariya Behrouzi|arXiv (Cornell University)|Mar 18, 2022
Bayesian Methods and Mixture Models被引用数 5
ひとこと要約

本稿では、マイクロバイオームシークエンシングデータなど、高次元で異種のカウントデータにおける依存構造を推定するため、パラメトリックな離散ワイブル周辺分布を備えたベイジアンガウス型コプシラグラフィカルモデルを提案する。共変量の影響を周辺分布に組み込み、拡張ランク尤度を用いた連続時刻の出生・死滅探索を採用することで、周辺効果とネットワーク構造の同時推定が可能となり、不確実性の完全な定量化が達成される。この手法は、生物学的に関連する微生物相互作用を検出する点で、標準的手法を上回る性能を発揮する。

ABSTRACT

High dimensional and heterogeneous count data are collected in various applied fields. In this paper, we look closely at high-resolution sequencing data on the microbiome, which have enabled researchers to study the genomes of entire microbial communities. Revealing the underlying interactions between these communities is of vital importance to learn how microbes influence human health. To perform structural learning from multivariate count data such as these, we develop a novel Gaussian copula graphical model with two key elements. Firstly, we employ parametric regression to characterize the marginal distributions. This step is crucial for accommodating the impact of external covariates. Neglecting this adjustment could potentially introduce distortions in the inference of the underlying network of dependences. Secondly, we advance a Bayesian structure learning framework, based on a computationally efficient search algorithm that is suited to high dimensionality. The approach returns simultaneous inference of the marginal effects and of the dependence structure, including graph uncertainty estimates. A simulation study and a real data analysis of microbiome data highlight the applicability of the proposed approach at inferring networks from multivariate count data in general, and its relevance to microbiome analyses in particular. The proposed method is implemented in the R package BDgraph.

研究の動機と目的

  • マイクロバイオーム研究に共通する高次元で異種のカウントデータにおける構造的学習の課題に対処すること。
  • 外部共変量を周辺分布に組み込むことで、誤った依存関係を低減し、ネットワーク回復の精度を向上させること。
  • 周辺効果とグラフ構造の両方における不確実性を考慮した、計算的に効率的なベイジアンフレームワークの開発。
  • 腸内および口腔マイクロバイオータのような複雑なシステムにおける微生物相互作用の正確な推定を可能にすること。
  • 過剰なゼロ値と過分散を示すカウントデータに対して、非パラメトリックまたは変換手法の代替として柔軟なパラメトリックな代替手法の提供。

提案手法

  • 条件付き独立性グラフに周辺分布を結びつけるためにガウス型コプシラを用い、非正規依存構造のモデリングを可能にする。
  • 周辺分布のパラメトリックモデリングに離散ワイブル回帰を採用し、共変量からの位置と分散効果を同時に捉えることを可能にする。
  • 離散データにおける非単調性に対処するため、拡張ランク尤度を適用し、潜在ガウス空間における一貫性のある推定を可能にする。
  • 高次元設定における効率的なベイジアン構造学習のため、連続時刻の出生・死滅プロセスを用いる。
  • グラフ構造と部分相関の両方の周辺事後分布を統合し、事後エッジ確率を介して不確実性推定を含む完全な事後推論を実現する。
  • 実世界のマイクロバイオームデータへの応用を容易にするために、RパッケージBDgraphに本手法を実装する。

実験結果

リサーチクエスチョン

  • RQ1パラメトリック周辺分布を備えたベイジアンコプシラグラフィカルモデルは、標準的手法と比較して、高次元カウントデータにおけるネットワーク推定を改善できるか?
  • RQ2周辺分布に共変量を組み込むことで、推定された微生物相互作用ネットワークの正確性と頑健性はどのように変化するか?
  • RQ3離散ワイブル周辺分布の使用が、マイクロバイオームカウントデータにおける異質性および過分散・低分散をどの程度適切に捉えることができるか?
  • RQ4本手法は、高次元設定におけるグラフ構造とエッジ強度の不確実性をどの程度正確に定量化できるか?
  • RQ5腸内および口腔マイクロバイオータ系における推定されたネットワーク構造から、どのような生物学的知見が得られるか?

主な発見

  • 本手法は、生物学的に妥当な微生物相互作用ネットワークを効果的に回復した。腸内および唾液マイクロバイオータ群内での結合が、それらの間の結合よりも強く観察された。
  • 平均事後エッジ確率は腸内が4.7%、唾液が10%であり、それぞれ89%および87%のエッジが事後確率0.5以上であった。
  • グループ間の結合についても有意義であり、86%のエッジが事後確率0.5以上で、平均絶対部分相関が0.17であった。これは、腸内と口腔マイクロバイオータ間の機能的クロスタクトを示唆している。
  • 離散ワイブル周辺分布に共変量を組み込むことで、誤った依存関係が低減され、ネットワーク推定の精度が向上した。
  • ベイジアンフレームワークにより完全な不確実性定量化が達成され、事後エッジ確率と部分相関推定値を用いた高次元設定下での頑健な推論が可能になった。
  • 本手法は、炎症性腸疾患、肥満、2型糖尿病に関連するフィルミクテス-バクテロイデーテス相互作用を同定し、治療標的の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。