Skip to main content
QUICK REVIEW

[論文レビュー] Nonnegative spatial factorization

F. William Townes, Barbara E. Engelhardt|arXiv (Cornell University)|Oct 12, 2021
Genetic and phenotypic traits in livestock参考文献 60被引用数 9
ひとこと要約

本稿では、非負性行列分解とガウス過程を組み合わせた確率的次元削減モデルであるNonnegative Spatial Factorization (NSF) を提案する。NSFは、多変量空間的トランスクリプトミクスデータにおける解釈可能で空間的に一貫性のあるパターンを同定する。非負の要因と負荷係数により解釈性が向上し、実数値モデル(MEFISTOなど)を上回る一般化可能な空間的遺伝子発現パターンの同定が可能であり、ハイブリッド空間的/非空間的拡張により空間的影響の定量的評価が可能である。

ABSTRACT

Gaussian processes are widely used for the analysis of spatial data due to their nonparametric flexibility and ability to quantify uncertainty, and recently developed scalable approximations have facilitated application to massive datasets. For multivariate outcomes, linear models of coregionalization combine dimension reduction with spatial correlation. However, their real-valued latent factors and loadings are difficult to interpret because, unlike nonnegative models, they do not recover a parts-based representation. We present nonnegative spatial factorization (NSF), a spatially-aware probabilistic dimension reduction model that naturally encourages sparsity. We compare NSF to real-valued spatial factorizations such as MEFISTO and nonspatial dimension reduction methods using simulations and high-dimensional spatial transcriptomics data. NSF identifies generalizable spatial patterns of gene expression. Since not all patterns of gene expression are spatial, we also propose a hybrid extension of NSF that combines spatial and nonspatial components, enabling quantification of spatial importance for both observations and features. A TensorFlow implementation of NSF is available from https://github.com/willtownes/nsf-paper .

研究の動機と目的

  • 多変量空間的トランスクリプトミクスデータにおける実数値空間的要因分解モデルの解釈性の欠如に対処すること。
  • 空間的構造を保持しつつ、遺伝子発現パターンの部分ベースで非負の表現を可能にする次元削減手法を開発すること。
  • 遺伝子発現特徴における空間的および非空間的成分の相対的重要性を定量化すること。
  • 正規化に起因する歪みが生じない、生のカウントデータに直接作用するスケーラブルで確率的フレームワークを提供すること。
  • 高次元空間的トランスクリプトミクスデータセットにおける生物学的に意味のある空間的パターンの発見を可能にすること。

提案手法

  • NSFは、空間的に相関するガウス過程要因の非負の線形結合として、高次元空間的遺伝子発現データをモデル化する。
  • 部分ベースで解釈可能な表現を保証するため、要因および負荷係数に非負制約を課した確率的潜在変数フレームワークを採用する。
  • 大規模な空間データセットにおけるスケーラブルな推論を実現するため、スパース精度行列(SPDE)を用いた確率的変分推論を用いる。
  • ハイブリッド拡張であるNSF-Hは、特徴を空間的および非空間的要因の混合としてモデル化することで、空間的および非空間的成分を統合する。
  • 正規化によるアーティファクトを回避するため、生のUMIカウントに直接学習を実行し、負の二項分布尤度を用いる。
  • SPDEスタイルの平滑化処理により、負荷行列が解釈可能であり、各成分にわたる行の和が1になるように保証する。

実験結果

リサーチクエスチョン

  • RQ1非負空間的要因分解は、実数値モデルに比べて、空間的トランスクリプトミクスデータにおいてより解釈可能で一般化可能な空間的パターンを回復できるか?
  • RQ2非負制約の導入が、多変量遺伝子発現データにおける空間的に相関する潜在的要因の解釈性をどのように向上させるか?
  • RQ3遺伝子発現における空間的パターンがデータ全体の構造にどの程度寄与しているか、そしてその寄与度を定量化できるか?
  • RQ4空間的および非空間的成分を分離するハイブリッドモデルは、空間的トランスクリプトミクスデータセットにおける真の生物学的構造をよりよく捉えることができるか?
  • RQ5NSFは、MEFISTO や標準的な scRNA-seq DR ツールに比べて、生物学的に関連のある空間的パターンを同定する上で優れているか?

主な発見

  • NSFは、Visiumマウス脳、Slide-seqV2マウス海馬、XYZeqマウス肝臓など、複数の空間的トランスクリプトミクスデータセットにおいて、一般化可能な空間的遺伝子発現パターンを効果的に同定した。
  • NSFにおける非負制約により、各成分に属する遺伝子が一貫した生物学的機能および細胞タイプ関連性を示す、より解釈可能な負荷係数が得られた。
  • Visiumマウス脳データセットでは、歯状回およびCA1領域に特化した成分が同定され、GO用語による神経細胞およびシナプス機能の関連性が裏付けられた。
  • ハイブリッドモデルNSF-Hでは、60–80%の遺伝子発現変動が、組織および成分に応じて空間的要因によって駆動されていることが定量的に評価された。
  • 特に、領域特異的な遺伝子発現プログラムの検出において、MEFISTO や標準的なDR手法を上回る性能を示した。
  • 12コアのCPUを用いて、Slide-seqV2データ(例:180 GBメモリ)においてもスケーラブルな推論を達成し、高次元空間データへの実用的応用を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。