Skip to main content
QUICK REVIEW

[論文レビュー] A Unified Statistical Framework for RNA Sequence Data from Individual Cells and Tissue

Lingxue Zhu, Jing Lei|arXiv (Cornell University)|Sep 26, 2016
Single-cell and spatial transcriptomics被引用数 4
ひとこと要約

本論文は、単細胞およびバッチ組織のRNA-seqデータを統合的に分析する包括的な階層ベイズモデルを提案する。単細胞データのドロップアウトイベントは、EMおよびギブスサンプリングを用いた経験的ベイズ推定により明示的にモデル化される。このフレームワークは、遺伝子発現の補完と細胞型デコンボリューションを改善し、シミュレーションおよび胎児脳データ応用において既存手法を上回る性能を示す。

ABSTRACT

Recent advances in technology have enabled the measurement of RNA levels for individual cells. Compared to traditional tissue-level RNA-seq data, single cell sequencing yields valuable insights about gene expression profiles for different cell types, which is potentially critical for understanding many complex human diseases. However, developing quantitative tools for such data remains challenging because of high levels of technical noise, especially the events. A happens when the RNA for a gene fails to be amplified prior to sequencing, producing a false zero in the observed data. In this paper, we propose a unified statistical framework for both single cell and tissue RNA-seq data, formulated as a hierarchical model. Our framework borrows the strength from both data sources and carefully models the dropouts in single cell data, leading to a more accurate estimation of cell type specific gene expression profile. In addition, our model naturally provides inference on (i) the dropout entries in single cell data that need to be imputed for downstream analyses, and (ii) the mixing proportions of different cell types in tissue samples. We adopt an empirical Bayes approach, where parameters are estimated using the EM algorithm and approximate inference is obtained by Gibbs sampling. Simulation results illustrate that our framework outperforms existing approaches both in correcting for dropouts in single cell data, as well as in deconvolving tissue samples. We also demonstrate an application to gene expression data on fetal brains, where our model successfully imputes the dropout genes and reveals cell type specific expression patterns.

研究の動機と目的

  • 単細胞およびバッチ組織のRNA-seqデータを統合する統計的フレームワークを構築し、遺伝子発現解析の精度を向上させること。
  • 単細胞RNA-seqにおけるドロップアウトイベントの課題に対処すること。ドロップアウトは偽のゼロ発現値を生じさせ、正確なプロファイリングを阻害する。
  • 異なるデータタイプ間で情報を共有することで、細胞型特異的遺伝子発現プロファイルの正確な推定を可能にすること。
  • 後続の補完のために、単細胞データにおける欠落(ドロップアウト)エントリに対する原理的推論を提供すること。
  • 単細胞リファレンスプロファイルを用いて、バッチ組織サンプルの細胞型構成をデコンボリューションにより推定すること。

提案手法

  • 単細胞およびバッチ組織RNA-seqデータの両方で共通のパラメータを共有する階層ベイズモデルを定式化し、推定を改善する。
  • 階層構造内にゼロインflatedまたはドロップアウト生成プロセスを用いて、単細胞データにおけるドロップアウトイベントを明示的にモデル化する。
  • 観測データを両方のソースから得て、ハイパーパrameterの経験的ベイズ推定にEMアルゴリズムを適用する。
  • ドロップアウトインジケーターや細胞型割合といった潜在変数の事後分布推論にギブスサンプリングを用いる。
  • 単細胞データをリファレンスとして統合し、混合組織サンプルのデコンボリューションと細胞型構成の推定を可能にする。
  • 両方のデータタイプからの情報を活用して、ドロップアウトイベントの補完を強化し、発現プロファイル推定の精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1包括的な統計的モデルは、単細胞およびバッチ組織のRNA-seqデータを効果的に統合し、遺伝子発現推定を改善できるか?
  • RQ2バッチ組織データからの情報を用いて、単細胞RNA-seqデータにおけるドロップアウトイベントを正確にモデル化・補完できるか?
  • RQ3統合モデルフレームワークは、バッチ組織サンプルの細胞型割合のデコンボリューションにどの程度改善をもたらすか?
  • RQ4本手法は、ドロップアウトイベントの補完および真の遺伝子発現プロファイルの回復において、既存手法を上回るか?
  • RQ5本モデルは、胎児脳のような複雑な組織において、生物学的に意味のある細胞型特異的発現パターンを明らかにできるか?

主な発見

  • シミュレーション研究において、本フレームワークは単細胞RNA-seqデータにおけるドロップアウトイベントの是正において、既存手法を顕著に上回ることが示された。
  • 本モデルは、欠落(ドロップアウト)エントリに対する正確な推論を可能にし、後続解析のための信頼性の高い補完を提供した。
  • 本フレームワークは、バッチ組織サンプルの細胞型割合を効果的にデコンボリューションし、ベースライン手法と比較して精度が向上した。
  • 胎児脳データへの応用において、ドロップアウト遺伝子の効果的な補完を通じて、細胞型特異的発現パターンを同定した。
  • EMおよびギブスサンプリングを用いた経験的ベイズにより、複雑で高次元のデータに対して堅牢かつ計算的に実行可能な推論が可能になった。
  • 単細胞およびバッチデータの統合的モデリングにより、個別に解析する場合よりも、遺伝子発現プロファイルの推定がより正確になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。