Skip to main content
QUICK REVIEW

[論文レビュー] A Guideline for the Statistical Analysis of Compositional Data in Immunology

Jinkyung Yoo, Zequn Sun|arXiv (Cornell University)|Jan 20, 2022
Oral microbiology and periodontitis research被引用数 4
ひとこと要約

本稿は、免疫細胞構成データの分析における包括的な統計的ガイドラインを提供し、誤った結論を避けるために組成データ解析を強調している。対数比回帰とディリクレ回帰を比較し、両手法が有効であるが、有意性の結果が異なることを示している。対数比回帰では、人種と有意に関連する4つの免疫細胞(T.cells.CD4、B.cells、T.cells.CD8、マクロファージ)が特定されたが、ディリクレ回帰ではそのうち2つにとどまった。

ABSTRACT

The study of immune cellular composition has been of great scientific interest in immunology because of the generation of multiple large-scale data. From the statistical point of view, such immune cellular data should be treated as compositional. In compositional data, each element is positive, and all the elements sum to a constant, which can be set to one in general. Standard statistical methods are not directly applicable for the analysis of compositional data because they do not appropriately handle correlations between the compositional elements. In this paper, we review statistical methods for compositional data analysis and illustrate them in the context of immunology. Specifically, we focus on regression analyses using log-ratio transformations and the generalized linear model with Dirichlet distribution, discuss their theoretical foundations, and illustrate their applications with immune cellular fraction data generated from colorectal cancer patients.

研究の動機と目的

  • 免疫細胞構成データの分析における統計的課題に取り組む。これは、合計が一定であるという性質から、組成的データであるためである。
  • 標準的な統計的手法が組成的データに適用された場合の限界、特に誤った相関関係やスケール不変性の欠如を強調する。
  • 免疫学者および統計学者が組成的データ解析に適切な手法を選択するための実践的で根拠に基づいたガイドラインを提供する。
  • 実際の免疫細胞割合データの文脈において、2つの主要な手法である対数比回帰とディリクレ回帰の性能と解釈可能性を比較する。
  • 手法選択が、特に結腸直腸がんにおける免疫細胞構成と患者の人種との関連を同定する際の結論に与える影響を示す。

提案手法

  • 免疫細胞割合を $S^D$ 内の組成としてモデル化するため、Aitchison単体幾何を用いる。ここで、成分の合計は1であり、すべて正である。
  • 加法的対数比(ALR)変換を適用して、組成的データを実数空間に変換し、スケール不変性を保った標準回帰モデルの使用を可能にする。
  • ALR変換された応答変数を用いて多変量対数対比回帰モデルをフィットさせ、回帰係数が基準成分の選択に依存しないことを保証する。
  • ディリクレ回帰を実装して、直接的に組成的応答をモデル化する。細胞割合にディリクレ分布を仮定し、予測変数に対して線形予測子を設定する。
  • モデルの適合度を評価し、影響力のある観測値を検出するために、合成残差プロットと成分別過分散統計量を用いる。
  • 診断プロットと統計的検査を通じて、モデルの仮定(等分散性および過分散)を検証する。

実験結果

リサーチクエスチョン

  • RQ1対数比回帰とディリクレ回帰は、結腸直腸がんにおける免疫細胞構成と患者の人種との間の有意な関連を同定する上で、どのように比較されるか?
  • RQ2標準的な統計的手法を組成的免疫細胞データに適用した場合の影響は何か。なぜそれらは不適切なのか?
  • RQ3免疫細胞割合解析の文脈において、対数比回帰とディリクレ回帰の解釈可能性および統計的性質は、どのように異なるか?
  • RQ4等分散性および過分散といったモデルの仮定が、組成的データ解析における結論の信頼性にどの程度影響を与えるか?
  • RQ5統計的手法の選択が、特に人種差に起因する主要な免疫細胞マーカーを同定する際に、異なる生物学的結論をもたらす可能性はどれほどか?

主な発見

  • 対数比回帰では、T.cells.CD4、B.cells、T.cells.CD8、マクロファージという4つの免疫細胞が人種と有意に関連していると特定されたが、ディリクレ回帰ではそのうち2つにとどまった。
  • ALR変換からの対数対比係数は、基準成分の選択に依存しないため、対数比アプローチの堅牢性を裏付けた。
  • ディリクレモデルの合成残差プロットから、一部の観測値で残差が40を超えることが判明したが、大多数の残差は20未満であり、一般的に良好なモデル適合が得られた。
  • 成分別過分散プロットでは、全体として顕著な過分散の問題は認められなかったが、特定の細胞タイプに関しては極端な値が観察された。
  • 年齢は両モデルにおいて免疫細胞構成に有意な影響を持たなかったため、この分析において人種が主な関心変数であることが示された。
  • T.cells.CD4とB.cellsの和を、T.cells.CD8とマクロファージの和で割った比が、2つの人種群を区別する意味のある要約統計量であると特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。