Skip to main content
QUICK REVIEW

[論文レビュー] Generalized simultaneous component analysis of binary and quantitative data

Yipeng Song, Johan A. Westerhuis|arXiv (Cornell University)|Jul 13, 2018
Gene expression and cancer classification参考文献 27被引用数 5
ひとこと要約

本稿では、低ランク行列近似における過剰適合を防ぐために凹型核ノルムペナルティを用いる、バイナリおよび定量的生物学的データの統合的解析のための一般化同時成分分析(GSCA)を提案する。この手法は、iClusterPlusなどの既存手法よりも精度と速度に優れ、共有構造を介して遺伝子発現データと統合することで、コピー数異常の生物学的に意味のある解釈を可能にする。

ABSTRACT

In the current era of systems biological research there is a need for the integrative analysis of binary and quantitative genomics data sets measured on the same objects. One standard tool of exploring the underlying dependence structure present in multiple quantitative data sets is simultaneous component analysis (SCA) model. However, it does not have any provisions when a part of the data are binary. To this end, we propose the generalized SCA (GSCA) model, which takes into account the distinct mathematical properties of binary and quantitative measurements in the maximum likelihood framework. Like in the SCA model, a common low dimensional subspace is assumed to represent the shared information between these two distinct types of measurements. However, the GSCA model can easily be overfitted when a rank larger than one is used, leading to some of the estimated parameters to become very large. To achieve a low rank solution and combat overfitting, we propose to use a concave variant of the nuclear norm penalty. An efficient majorization algorithm is developed to fit this model with different concave penalties. Realistic simulations (low signal-to-noise ratio and highly imbalanced binary data) are used to evaluate the performance of the proposed model in recovering the underlying structure. Also, a missing value based cross validation procedure is implemented for model selection. We illustrate the usefulness of the GSCA model for exploratory data analysis of quantitative gene expression and binary copy number aberration (CNA) measurements obtained from the GDSC1000 data sets.

研究の動機と目的

  • 特にシステム生物学における、結合されたバイナリおよび定量的生物学的データの統合的解析のための手法の不足に対処すること。
  • ランクが1より大きい場合に一般化SCEモデルで生じる過剰適合を克服すること、これはパラメータの発散を引き起こす。
  • バイナリおよび定量的データの異なる統計的性質を統一フレームワーク内で適切に扱う、頑健で効率的な手法の開発。
  • 不均衡でノイズの多い生物学的データセットにおいて、元の低ランク構造の正確な回復を可能にすること。
  • 大規模データに対してMCMCベースの手法(例:iClusterPlus)の計算的に効率的な代替手段を提供すること。

提案手法

  • バイナリおよび定量的データに対して指数型分布族下での最尤推定を用いる一般化SCEモデルを提案する。
  • 潜在的成分行列の特異値に凹型ペナルティ(例:$L_q$、GDP、SCAD)を適用し、低ランク構造を誘導するとともに過剰適合を低減する。
  • すべてのパラメータに対して閉形式更新が可能な主要化最小化(MM)アルゴリズムを構築し、計算効率を確保する。
  • モデル選択および最適なペナルティチューニングのため、欠損値に基づく交差検証手順を用いる。
  • 識別可能性および安定性を確保するため、負荷行列に直交制約 $\mathbf{A}^T\mathbf{A} = \mathbf{I}_R$ を課す。
  • 凹型ペナルティによるソフトしきい値処理を採用し、主要な特異値よりも重要でない特異値をより強く縮小することで、凸ペナルティによるバイアスを回避する。

実験結果

リサーチクエスチョン

  • RQ1凹型ペナルティを用いた一般化SCEモデルは、バイナリおよび定量的オミクスデータを効果的に統合し、それらの異なる統計的性質を尊重できるか?
  • RQ2GSCAにおける過剰適合の制御および低ランク近似の改善に関して、凹型ペナルティは核ノルムペナルティと比較してどのように優れるか?
  • RQ3本手法は、信号対ノイズ比が低く、バイナリデータが不均衡なシミュレーテッドデータにおいて、真の低ランク構造を回復できるか?
  • RQ4遺伝子発現パターンに従ってガイドされた場合、GSCAモデルはコピー数異常(CNA)の生物学的解釈性を向上させられるか?
  • RQ5推定精度および計算速度の観点から、GSCAはiClusterPlusと比較してどのように性能を発揮するか?

主な発見

  • 凹型ペナルティ(特に $L_q$ および GDP)を用いたGSCAモデルは、シミュレーションにおいて核ノルムペナルティを上回り、真の低ランク構造の回復に成功し、一般化誤差が低く、ランク推定がより正確であった。
  • $L_q$ および GDP ペナルティは、間接的なバイナリ観測およびノイズの多い定量的観測から、シミュレートされた低ランク構造をほぼ正確に回復した。
  • SCAD ペナルティは、大きな特異値の縮小が不十分で過剰適合を引き起こし、小さな値を過剰に縮小するため、性能が低かった。
  • GDP ペナルティを用いたGSCAモデルは、特にバイナリデータが不均衡な状況下でも、iClusterPlusよりも著しく高速かつ頑健であった。
  • GDSC1000データ解析において、GSCAは生物学的に関連するパターンを明らかにした:MYCの増幅は肺アデノカルシノーマおよび乳がんと関連し、ERBB2の増幅は乳がんと関連し、PTENの欠失はメラノーマと関連していた—これらは既知のがん学文献と整合した。
  • 本モデルは、遺伝子発現データとの共有構造を通じてCNAデータの解釈を可能にし、CNAパターンが定量的データと統合されない限り生物学的意味を持たないことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。