Skip to main content
QUICK REVIEW

[論文レビュー] Stacked Autoencoder Based Multi-Omics Data Integration for Cancer Survival Prediction

Desheng Wu, Qiulian Fang|arXiv (Cornell University)|Jul 8, 2022
Bioinformatics and Genomic Networks被引用数 5
ひとこと要約

本稿では、がん生存予測のための多様なオミックスデータ(例:遺伝子発現、CNV)と臨床データを統合するスタックドオートエンコーダーに基づく深層学習フレームワーク、SAEsurv-netを提案する。2段階の次元削減戦略(まずオミックスタイプごとに、次にオミックス間統合のために)を適用することで、高次元性とデータの異種性を効果的に軽減し、TCGAデータセット上で単一オミックスおよび最先端手法を上回る優れた性能を達成した。

ABSTRACT

Cancer survival prediction is important for developing personalized treatments and inducing disease-causing mechanisms. Multi-omics data integration is attracting widespread interest in cancer research for providing information for understanding cancer progression at multiple genetic levels. Many works, however, are limited because of the high dimensionality and heterogeneity of multi-omics data. In this paper, we propose a novel method to integrate multi-omics data for cancer survival prediction, called Stacked AutoEncoder-based Survival Prediction Neural Network (SAEsurv-net). In the cancer survival prediction for TCGA cases, SAEsurv-net addresses the curse of dimensionality with a two-stage dimensionality reduction strategy and handles multi-omics heterogeneity with a stacked autoencoder model. The two-stage dimensionality reduction strategy achieves a balance between computation complexity and information exploiting. The stacked autoencoder model removes most heterogeneities such as data's type and size in the first group of autoencoders, and integrates multiple omics data in the second autoencoder. The experiments show that SAEsurv-net outperforms models based on a single type of data as well as other state-of-the-art methods.

研究の動機と目的

  • がん生存予測におけるオミックスデータ統合における高次元性とデータの異種性の課題に対処すること。
  • 多様なオミックスデータタイプ間の非線形的関係を効果的に捉えることができる深層学習フレームワークの開発。
  • 統一的かつ低次元の潜在空間に多様なオミックスデータを統合することで、予測精度の向上。
  • 2段階の次元削減戦略により、計算効率と情報保持のバランスを図ること。
  • TCGAデータを用いて、さまざまながん種に適用可能なスケーラブルで一般化可能な手法の提供。

提案手法

  • 2段階の次元削減戦略を採用:まず、各オミックスタイプ(例:遺伝子発現、CNV)ごとに個別のオートエンコーダーが次元を削減し、次に最終的なオートエンコーダーがオミックス間で削減された特徴量を統合。
  • スタックドオートエンコーダーを用いて、異種なオミックスデータの非線形的かつ低次元の表現を学習し、ボトルネック層が圧縮と特徴抽出を促進。
  • 異なるオミックスタイプに応じて別個のオートエンコーダー・アーキテクチャを採用し、各データセットに最適化されたハイパーパrameter(例:学習率、ドロップアウト、活性化関数)を設定。
  • 最終的なリスク予測ネットワークを、統合された潜在表現上で訓練し、生存損失関数を用いて生存予後を予測。
  • ハイパーパrameterチューニングは、がん種ごとに(GBM、OV、BRCA)検証セットを用いて実施し、複数エポックおよびミニバッチでモデルを訓練。
  • 過学習を軽減し一般化性能を向上させるために、正規化および正則化(L2およびL1)をフレームワークに組み込む。

実験結果

リサーチクエスチョン

  • RQ1スタックドオートエンコーダーに基づくモデルは、異種な多様なオミックスデータ(例:遺伝子発現、CNV)をがん生存予測に効果的に統合できるか?
  • RQ22段階の次元削減戦略は、計算複雑性を低減しつつ予測性能を向上させるか?
  • RQ3SAEsurv-netは、単一オミックスモデルおよび最先端の多様なオミックス統合手法と比較して、生存予測精度に優れているか?
  • RQ4モデルは、データ次元削減の過程で生物学的に関連する特徴をどれほど保持しているか?
  • RQ5本フレームワークは、最小限の再設定で、さまざまながん種(GBM、OV、BRCA)に一般化可能か?

主な発見

  • SAEsurv-netは、TCGAのGBM、OV、BRCAデータセットにおいて、単一オミックスモデルおよび多数の最先端手法を上回る生存予測精度を達成した。
  • 2段階の次元削減戦略は、特徴空間を効果的に削減しながらも予測情報の保持に成功し、計算コストとモデル性能のバランスを図った。
  • スタックドオートエンコーダーのアーキテクチャは、オミックスタイプ間でのデータの異種性を効果的に軽減し、多様なデータモodalの統合を可能にした。
  • 全比較手法の中で最高のC-index値を達成し、個々のがん種においてベースラインモデル比でC-indexが最大0.05~0.08向上した。
  • ハイパーパrameter設定は、各がん種ごとに最適化され、異なる学習率、ドロップアウト率、ボトルネックユニットが最適なパフォーマンスをもたらした。
  • ソースコードはGitHubで公開されており、再現性が保たれ、他のがん種やオミックスデータへの応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。