Skip to main content
QUICK REVIEW

[論文レビュー] Group-sparse SVD Models and Their Applications in Biological Data

Wenwen Min, Juan Liu|arXiv (Cornell University)|Jul 28, 2018
Gene expression and cancer classification参考文献 43被引用数 3
ひとこと要約

本稿では、遺伝子発現データのバイクラスタリングのため、生物学的知識(例:遺伝子パスウェイ)を低ランク行列分解に統合するグループスパースSVDモデル—GL₁-SVD、GL₀-SVD、OGL₁-SVD、OGL₀-SVD—を提案する。非重複および重複グループ構造を用いたグループラassoおよびL₀ノルム正則化を活用することで、従来の最先端のスパースSVD手法に比べ、生物学的解釈可能性が向上し、より関連性の高い遺伝子モジュールを同定できる。

ABSTRACT

Sparse Singular Value Decomposition (SVD) models have been proposed for biclustering high dimensional gene expression data to identify block patterns with similar expressions. However, these models do not take into account prior group effects upon variable selection. To this end, we first propose group-sparse SVD models with group Lasso (GL1-SVD) and group L0-norm penalty (GL0-SVD) for non-overlapping group structure of variables. However, such group-sparse SVD models limit their applicability in some problems with overlapping structure. Thus, we also propose two group-sparse SVD models with overlapping group Lasso (OGL1-SVD) and overlapping group L0-norm penalty (OGL0-SVD). We first adopt an alternating iterative strategy to solve GL1-SVD based on a block coordinate descent method, and GL0-SVD based on a projection method. The key of solving OGL1-SVD is a proximal operator with overlapping group Lasso penalty. We employ an alternating direction method of multipliers (ADMM) to solve the proximal operator. Similarly, we develop an approximate method to solve OGL0-SVD. Applications of these methods and comparison with competing ones using simulated data demonstrate their effectiveness. Extensive applications of them onto several real gene expression data with gene prior group knowledge identify some biologically interpretable gene modules.

研究の動機と目的

  • 既存のスパースSVDモデルが遺伝子発現データにおける事前生物学的グループ構造を無視するという限界に対処すること。
  • 非重複および重複グループ情報(例:遺伝子パスウェイ)を統合する構造的スパースSVDモデルを開発し、生物学的解釈可能性を向上させること。
  • ブロック座標降下法、射影法、ADMMを用いた効率的な最適化アルゴリズムを提案し、得られるグループスパースSVD問題を解くこと。
  • シミュレートおよび実際の遺伝子発現データセット上でモデルを検証し、生物学的に意味のある遺伝子モジュールの同定が向上することを示すこと。
  • 今後、単細胞RNA-seqやマルチソースオミクスデータを含む、高次元生物学的データへのスパースSVDの適用範囲を拡張すること。

提案手法

  • 非重複グループラassoおよびL₀ノルムペナルティを用いて、特異ベクトルにおける構造的スパarsityを誘導するGL₁-SVDおよびGL₀-SVDを提案する。
  • GL₁-SVDにはブロック座標降下法、GL₀-SVDには射影に基づく手法を用いて最適化問題を解く。
  • 遺伝子が複数のパスウェイに属する可能性がある重複グループ構造をモデル化するため、OGL₁-SVDおよびOGL₀-SVDを導入する。
  • OGL₁-SVDにおける重複グループラassoの近位作用素を計算するADMMベースのアルゴリズムを開発する。
  • L₀ノルムペナルティの非凸性のため、OGL₀-SVD問題を解くためにグリーディ近似法を適用する。
  • 低ランク近似とグループスパース特異ベクトルを同時に推定するために、交互反復最適化を適用する。

実験結果

リサーチクエスチョン

  • RQ1非重複グループペナルティを用いたグループスパースSVDモデルは、遺伝子発現データにおける生物学的に整合性のある遺伝子モジュールの同定を改善できるか?
  • RQ2遺伝子が複数のパスウェイに属する重複グループ構造(例:複数のパスウェイにまたがる遺伝子)を統合することで、非重複モデルと比較してバイクラスタリングの解釈可能性および正確性がどのように向上するか?
  • RQ3OGL₁-SVDおよびOGL₀-SVDの計算的・統計的性能は、既存のスパースSVDおよびNMFベースの手法と比較してどの程度か?
  • RQ4提案されたモデルは、実際の遺伝子発現データセットにおいて、既知の生物学的関係(例:臓器特異的パスウェイやがん亜型)をどの程度回復できるか?
  • RQ5提案されたグループスパースSVDモデルは、単細胞RNA-seqやマルチオミクスデータなどの他の高次元生物学的データタイプへ拡張可能か?

主な発見

  • OGL₀-SVDモデルは、CGP + KEGGデータセットから10の遺伝子機能モジュールを同定し、各モジュールが少なくとも1つのがんまたは臓器タイプで有意に豊富化されていた(p < 0.05、超幾何検定)。
  • モジュール1は血液組織に特異的に関連し、リンパ球関連のがんと強く関連しており、B細胞受容体シグナル伝達および原発性免疫不全を含む5つのKEGGパスウェイと強く重複していた。
  • モジュール6は大腸、肝臓がんおよび消化管トランクト組織と特に関連し、補因子および凝固カスケードおよびPPARシグナル伝達などのパスウェイで有意に豊富化されていた。
  • OGL₀-SVDの上位10個の特異ベクトルペアは、CGP + KEGGデータセットの全分散の60%以上を説明しており、強力な低ランク構造の捉え込みを示している。
  • 最先端のスパースSVD手法と比較して、提案されたグループスパースモデルは、より生物学的に解釈可能で機能的に整合性のある遺伝子モジュールを同定した。
  • OGL₁-SVDおよびOGL₀-SVDモデルは最適化において計算的妥当性と収束性を示し、ADMMおよびグリーディ近似法により重複グループ問題の効果的解法が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。