Skip to main content
QUICK REVIEW

[論文レビュー] A deep generative model for gene expression profiles from single-cell RNA sequencing

Romain Lopez, Jeffrey Regier|arXiv (Cornell University)|Sep 7, 2017
Single-cell and spatial transcriptomics参考文献 12被引用数 5
ひとこと要約

この論文は、変分推論とニューラルネットワークを用いて遺伝子発現をゼロインflatedネガティブバイノミアル分布としてモデル化し、生物学的変動と技術的ノイズを明示的に分離する、単一細胞RNA-Seqデータ向けの深層生成モデルであるscVIを提案する。これは1台のGPUで数百万細胞規模のデータセットにも効率的にスケーリングでき、補完、クラスタリング、差分発現解析の分野で最先端の性能を達成する。

ABSTRACT

We propose a probabilistic model for interpreting gene expression levels that are observed through single-cell RNA sequencing. In the model, each cell has a low-dimensional latent representation. Additional latent variables account for technical effects that may erroneously set some observations of gene expression levels to zero. Conditional distributions are specified by neural networks, giving the proposed model enough flexibility to fit the data well. We use variational inference and stochastic optimization to approximate the posterior distribution. The inference procedure scales to over one million cells, whereas competing algorithms do not. Even for smaller datasets, for several tasks, the proposed procedure outperforms state-of-the-art methods like ZIFA and ZINB-WaVE. We also extend our framework to account for batch effects and other confounding factors, and propose a Bayesian hypothesis test for differential expression that outperforms DESeq2.

研究の動機と目的

  • 既存の次元削減および補完手法が線形モデルやバッチ最適化に依存しており、大規模データセットにスケーリングできないという限界に対処する。
  • 技術的ノイズ(例:ドロップアウト、シークエンシング深度)を明示的にモデル化し、それらを根本的な生物学的状態から分離する、スケーラブルで微分可能かつ確率的フレームワークを構築する。
  • 不確実性の定量化を伴う統一された生成モデルを用いて、クラスタリング、補完、差分発現解析といった精度の高い下流タスクを可能にする。
  • ZIFA や ZINB-WaVE といった先行手法が直面するメモリおよび計算上のボトルネックを克服し、最大130万細胞規模のデータセットに対しても推論をスケーリングする。

提案手法

  • scVIは階層的生成プロセスを用いて遺伝子発現をモデル化する:潜在的細胞状態 $ z_n $ は標準正規分布から抽出され、遺伝子発現はガンマ分布に従う平均 $ w_{ng} $ とベルヌーイ分布に従うドロップアウトインジケータ $ h_{ng} $ を介してモデル化され、観測データ $ x_{ng} $ はゼロインフラテッドポisson分布に従う。
  • 平均と発現ドロップアウト確率をそれぞれパラメータ化する2つの深層ニューラルネットワーク $ f_w $ と $ f_h $ を使用する。共有重みとバッチ正則化を用いることで一般化性能を向上させる。
  • 計算不能な後方分布 $ p(z_n|x_n) $ を近似するために変分推論を用い、エンコーダーネットワークによってパrameter化されたガウス分布 $ q(z_n|x_n) $ を用いることで、エンドツーエンドの微分可能な学習が可能になる。
  • 確率的バックプロパゲーションにより変分下界を最適化し、離散的潜在変数について解析的マージン化を実施することで微分可能性と安定した最適化を確保する。
  • 差分発現検定のため、$ w_{ag} $ と $ w_{bg} $ の後方分布を用いたベイズ的仮説検定を定式化し、潜在変数のマルコフモンテカルロ統合を用いてベイズ因子を計算する。
  • シークエンシング深度やバッチなどの共変量 $ \gamma_n $ をサポートすることで、潜在空間における技術的要因と生物学的信号を分離可能にする。

実験結果

リサーチクエスチョン

  • RQ1微分可能推論を備えた深層生成モデルは、線形モデルやバッチ最適化手法に比べ、単一細胞RNA-seqデータにおけるクラスタリングおよび補完タスクで優れた性能を示せるか?
  • RQ2完全に生成的なモデルは、高次元かつゼロインフラテッドな単一細胞データにおいて、技術的ノイズ(例:ドロップアウト、バッチ効果)と真の生物学的変動を効果的に分離できるか?
  • RQ3100万細胞を超えるデータセットに対しても、正確性と計算効率を維持しながらスケーリング可能か?
  • RQ4モデルの確率的フレームワークは、単一細胞データにおける頑健で不確実性を考慮した差分発現検定を可能にするか?

主な発見

  • 1万細胞の脳データセットにおいて、scVIは補完誤差が1.048と最低を記録し、ZINB-WaVE(1.053)とMAGIC(1.806)を上回った。ゼロ出力予測誤差が0.742と低く、ドロップアウトイベントのモデリングが優れていることを示した。
  • 3,005細胞のマウス皮質データセットでは、scVIのシルエットスコアが0.285であり、ZINB-WaVE(0.260)、ZIFA(0.202)、FA(0.208)を大きく上回り、既知の細胞タイプの回復が優れていることを示した。
  • 12,039細胞のPBMCデータセットでは、scVIのシルエットスコアが0.379、QC相関係数が0.157であり、PCA(0.314と0.381)を上回り、不要な変動を効果的に除去しながら生物学的構造を保持していることを示した。
  • 130万細胞の全データセットを1台のGPUで2時間未満で学習完了した。一方、ZIFAとZINB-WaVEは32GB RAMで10万細胞のデータセットですでにメモリ不足に陥った。これは、scVIの優れたスケーラビリティを示している。
  • 差分発現検定において、scVIはバッチRNA-seqデータと高い相関(r ≈ 0.7)を示し、スクリーニングの順位が再現可能であった。これは、その生物学的妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。