[論文レビュー] Uncertainty Quantification in Multivariate Mixed Models for Mass Cytometry Data
本稿では、質量サイトメトリー解析における不確実性の定量化を目的として、多変量ポアソン対数正規分布混合モデルとロジスティック線形混合モデルの2つのベイジアン多変量混合モデルを提案する。これらのモデルは、生の単細胞多変量構造を保持する。妊婦研究に適用した結果、第1期から第3期にかけての蛋白質間相関が上昇していることが判明したが、交絡要因を考慮したうえで、要約統計量に基づく手法よりも再現性が向上した。
Mass cytometry technology enables the simultaneous measurement of over 40 proteins on single cells. This has helped immunologists to increase their understanding of heterogeneity, complexity, and lineage relationships of white blood cells. Current statistical methods often collapse the rich single-cell data into summary statistics before proceeding with downstream analysis, discarding the information in these multivariate datasets. In this article, our aim is to exhibit the use of statistical analyses on the raw, uncompressed data thus improving replicability, and exposing multivariate patterns and their associated uncertainty profiles. We show that multivariate generative models are a valid alternative to univariate hypothesis testing. We propose two models: a multivariate Poisson log-normal mixed model and a logistic linear mixed model. We show that these models are complementary and that either model can account for different confounders. We use Hamiltonian Monte Carlo to provide Bayesian uncertainty quantification. Our models applied to a recent pregnancy study successfully reproduce key findings while quantifying increased overall protein-to-protein correlations between first and third trimester.
研究の動機と目的
- 単細胞質量サイトメトリー解析の要約統計量への集約によって生じる情報損失を是正すること。
- 高次元単細胞データにおける多変量依存構造を保持し、不確実性を定量化する統計モデルの開発。
- 交絡要因(衝突型およびパイプ型)を混合効果構造を用いてモデル化し、より高い耐性性を実現すること。
- 多変量生成モデルが、単変量仮説検定よりも生物学的に有意義なパターンをより効果的に検出できることを示すこと。
- 単細胞免疫学における複雑な実験設計の再現可能で不確実性を考慮した解析を可能にすること。
提案手法
- 過分散およびマーカー間の相関を有するカウントデータをモデル化するため、多変量ポアソン対数正規分布混合モデル(PLMM)を用いる。
- ドナー固有のランダム効果を用いて、バイナリーマーカー発現状態をモデル化するため、ロジスティック線形混合モデル(LLMM)を適用する。
- 完全ベイジアン後方分布推定と不確実性定量化のため、ハミルトニアンモンテカルロ(HMC)を採用する。
- ドナー間の階層的変動を考慮するため、ドナーやサンプルにランダム効果を組み込む。
- 2つの補完的モデルを用いる:連続的カウントデータにはPLMM、バイナリーデータにはLLMMを適用し、交絡要因の堅牢な同定を可能にする。
- エンドツーエンド解析のための2つのRパッケージ(CytoGLMMとcytoeffect)を開発し、再現可能なビニペットと自動データダウンロード機能を備える。
実験結果
リサーチクエスチョン
- RQ1多変量生成モデルは、要約統計量に基づく手法よりも、生の質量サイトメトリー解析データにおける不確実性をより効果的に保持・定量化できるか?
- RQ2妊娠の各期にわたる蛋白質間相関はどのように変化するのか? そして、不確実性を伴って信頼性高く定量化できるか?
- RQ3衝突型およびパイプ型の交絡要因が、単細胞データにおける差分発現解析に及ぼす影響の程度はどの程度か? また、それらをどのようにモデル化できるか?
- RQ4HMCを用いたベイジアン混合モデルは、単変量検定や中央値要約法よりも、より正確で再現性の高い推論を提供できるか?
- RQ5モデル選択(PLMM 対 LLMM)が、複雑な実験設計における生物学的に有意義なパターンの検出に与える影響はどの程度か?
主な発見
- モデルは、元の妊婦研究で得られた主要な発見(第3期では第1期に比べて蛋白質間相関が上昇)を的確に再現した。
- 多変量ポアソン対数正規分布混合モデル(PLMM)は、単細胞マーカーのカウントにおける過分散および相関を効果的に捉えており、後方チェックにより大多数のマーカーで適切なフィットが確認された。
- ロジスティック線形混合モデル(LLMM)は、特定マーカーの発現が低いか高いかの細胞サブセットにおいても、堅牢な推論を提供した。
- PLMMは、8コアのCPUを用いて18万個の細胞(16ドナー分)をフィットさせるのに約6日間を要し、計算コストが主な制限要因であることが示された。
- 1ドナーあたり1,000細胞にサブサンプリングした場合、固定効果および標準誤差にはほとんど影響がなかったが、相関比較にはより大きな影響が及んだ。これは、相関推論の正確性を確保するには、全データ解析が不可欠であることを示唆している。
- 後方モデルチェックにより、特定の細胞サブセットにおけるpERK1/2でモデルの不適合が認められ、今後の研究ではゼロインflated拡張の導入が求められることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。