Skip to main content
QUICK REVIEW

[論文レビュー] PIntMF: Penalized Integrative Matrix Factorization Method for Multi-Omics Data

Morgane Pierre‐Jean, Florence Mauger|arXiv (Cornell University)|Mar 3, 2021
Gene expression and cancer classificationBiochemistry, Genetics and Molecular Biology参考文献 57被引用数 17
ひとこと要約

PIntMFは、スパarsity、非負性、等価制約を組み合わせた罰則付き統合的行列分解手法であり、マルチオミクスデータからサンプルを共同でクラスタリングし、関連するオミック変数を選択する。Lasso罰則を用いて変数選択を実施し、glmnetを介して正則化パラメータを自動でチューニングする。合成データおよび実際のデータ(TCGA膠芽腫、マウス肝臓データを含む)において、クラスタリング精度と変数選択の両面で最先端の手法を上回る性能を示した。

ABSTRACT

It is more and more common to explore the genome at diverse levels and not only at a single omic level. Through integrative statistical methods, omics data have the power to reveal new biological processes, potential biomarkers, and subgroups of a cohort. The matrix factorization (MF) is a unsupervised statistical method that allows giving a clustering of individuals, but also revealing relevant omic variables from the various blocks. Here, we present PIntMF (Penalized Integrative Matrix Factorization), a model of MF with sparsity, positivity and equality constraints.To induce sparsity in the model, we use a classical Lasso penalization on variable and individual matrices. For the matrix of samples, sparsity helps for the clustering, and normalization (matching an equality constraint) of inferred coefficients is added for a better interpretation. Besides, we add an automatic tuning of the sparsity parameters using the famous glmnet package. We also proposed three criteria to help the user to choose the number of latent variables. PIntMF was compared to other state-of-the-art integrative methods including feature selection techniques in both synthetic and real data. PIntMF succeeds in finding relevant clusters as well as variables in two types of simulated data (correlated and uncorrelated). Then, PIntMF was applied to two real datasets (Diet and cancer), and it reveals interpretable clusters linked to available clinical data. Our method outperforms the existing ones on two criteria (clustering and variable selection). We show that PIntMF is an easy, fast, and powerful tool to extract patterns and cluster samples from multi-omics data.

研究の動機と目的

  • マルチオミクスデータの統合的解析のための統一的かつ解釈可能な手法を開発し、サンプルの共同クラスタリングと関連オミック変数の選択を可能にすること。
  • 高次元性、データの異質性、小標本サイズといったマルチオミクス統合の課題に対処すること。
  • Lasso罰則と等価制約を用いて変数負荷のスパarsityとサンプルスコアの正規化を強制することで、解釈性を向上させること。
  • スパarsityパラメータの自動チューニングと、最適な潜在要因数の選択基準を提供すること。
  • 知られている構造を持つシミュレーテッドデータおよび実世界のデータセット(例:TCGAおよびBXDマウスデータ)を用いた性能評価を通じて、頑健性と生物学的妥当性を検証すること。

提案手法

  • PIntMFは、複数のオミックデータブロック(例:ゲノミクス、トランスクリプトミクス)に非負行列分解(NMF)を適用し、各ブロックを潜在的要因の集合に分解する。
  • 変数負荷行列(H^k)にLasso罰則を適用することで、オミックブロック全体における自動的変数選択を実現する。
  • サンプルスコア行列(W)に非負性と正規化(等価制約)を課すことで、クラスタリングの解釈性と安定性を向上させる。
  • H^kおよびW行列の両方にLasso罰則を適用する際の自動的・データ駆動的なチューニングに、glmnetパッケージを用いる。
  • 潜在変数の数の選択を支援するための3つの基準(平均二乗誤差(MSE)、分散説明割合(PVE)、コーペネティック相関係数)を提供する。
  • ブロック単位ではなく統合レベルでの初期化を実施することで、収束性と生物学的整合性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1統一的行列分解フレームワークは、異種のマルチオミクスデータを効果的に統合しつつ、サンプルのクラスタリングと関連変数の選択を両立できるか?
  • RQ2異なるデータ分布下でのクラスタリング精度と変数選択の観点から、PIntMFは最先端の統合的手法と比較してどのように性能を発揮するか?
  • RQ3PIntMFは、TCGA膠芽腫やマウス肝臓データなどの実際のマルチオミクスデータセットにおいて、解釈可能な生物学的サブグループとバイオマーカーを同定できるか?
  • RQ4統合的マルチオミクス解析における最適な潜在要因数の選択に最も信頼性が高い基準は何か?
  • RQ5PIntMFは、オミックブロック間で混合分布(例:正規分布、バイナリ、ベータ分布)を含むデータの異質性に対し、どの程度頑健か?

主な発見

  • 相関のないシミュレーテッドデータでは、PIntMFは最小限の分類誤差を伴い、優れたクラスタリング精度を達成し、さまざまなデータ分布(正規分布、バイナリ、ベータ分布)に対して頑健であることが示された。
  • 実データセットに基づく相関のあるシミュレーテッドデータでは、PIntMFは完全なクラスタリングと変数選択のAUROC > 90%を達成し、すべての比較手法を上回った。
  • TCGA膠芽腫データセットでは、PIntMFが全体生存期間と有意に関連する生物学的に解釈可能なサブグループを同定し、臨床的妥当性を裏付けた。
  • BXDマウス肝臓データセットでは、PIntMFが食事表型に関連する新しいサブグループを明らかにし、複雑な疾患モデリングにおける有効性を示した。
  • glmnetを介した正則化パラメータの自動チューニングにより、H^kおよびW行列がスパースとなり、解釈性と計算効率が向上した。
  • コーペネティック係数とPVEが、特に相関のないシミュレーション設定において、潜在変数の数の選択を支援する上で最も効果的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。