Skip to main content
QUICK REVIEW

[論文レビュー] Learning Genomic Representations to Predict Clinical Outcomes in Cancer

Safoora Yousefi, Congzheng Song|arXiv (Cornell University)|Sep 27, 2016
Cancer Genomics and Diagnostics参考文献 5被引用数 7
ひとこと要約

本稿では、高次元のがんゲノムデータから遺伝子発現表現を学習するためのスタックドノイズ除去オートエンコーダを用いた深層学習フレームワークを提案し、生存予測のためのコックス部分尤度によるファインチューニングを実施する。この手法は、リッジ回帰と比較して有意に高い concordance index (CI) を達成し、特に The Cancer Genome Atlas の脳腫瘍データにおいて ReLU 活性化関数を用いることで 5% の絶対的改善を示した。

ABSTRACT

Genomics are rapidly transforming medical practice and basic biomedical research, providing insights into disease mechanisms and improving therapeutic strategies, particularly in cancer. The ability to predict the future course of a patient's disease from high-dimensional genomic profiling will be essential in realizing the promise of genomic medicine, but presents significant challenges for state-of-the-art survival analysis methods. In this abstract we present an investigation in learning genomic representations with neural networks to predict patient survival in cancer. We demonstrate the advantages of this approach over existing survival analysis methods using brain tumor data.

研究の動機と目的

  • がんにおける高次元ゲノムプロファイルから患者の生存を予測する課題に取り組むこと。特に、予後予測に使用される変数は通常わずかである。
  • 深層ニューラルネットワークによる表現学習が、現在の臨床的サブタイピングを超えて未使用のゲノム変数から潜在的な予後信号を抽出できるかを検討すること。
  • バックプロパゲーションを用いて、時間発生までの結果を最適化する一方で、ゲノム表現を共同で学習する生存予測モデルを開発すること。
  • エラスティック・ネット正則化コックス回帰やランダム生存森といった標準的手法と比較して、深層学習ベースの生存モデルの性能を評価すること。

提案手法

  • 183次元のゲノム特徴量から、低次元表現をスタックドノイズ除去オートエンコーダを用いて事前学習し、頑健かつ圧縮された表現を学習する。
  • 生存予測の最適化のため、コックス部分尤度関数の勾配を逆伝播することで、学習済み表現をファインチューニングする。
  • ファインチューニング段階では、損失関数としてコックス部分尤度関数(式 2)を用い、エンドツーエンド学習のための勾配は式 (5) で計算する。
  • 限られたトレーニングデータのため、ハイパーパramータ空間(例:学習率、ネットワークの深さ、活性化関数)を効率的に探索するため、ガウス事前分布を用いたベイズ最適化を採用する。
  • 一般化性能を評価するために、データの並べ替えを伴う 10 折り交差検証を実施し、各折り返しで 70% をトレーニング、15% をバリデーション、15% をテストに使用する。
  • 予測と実際の生存時間の順位相関を測る指標として、concordance index (CI) を用いてモデル性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、従来の手法を上回る高次元のがんゲノム解析における生存予測を向上させる意味のあるゲノム表現を効果的に学習できるか?
  • RQ2標準的な生存解析手法(例:エラスティック・ネットコックス回帰)と比較して、オートエンコーダーによる表現学習は、直接的な生存モデリングに比べてどのように優れているか?
  • RQ3事前学習済みオートエンコーダーをコックス部分尤度でファインチューニングすることで、初期化から学習するか、単純なモデルと比較して、より優れた予後性能が得られるか?
  • RQ4異なるニューラルネットワークアーキテクチャーや活性化関数(例:ReLU と sigmoid)は、小標本・高次元設定における生存予測精度にどのように影響を与えるか?

主な発見

  • 提案された生存ニューラルネットワークは、ReLU 活性化関数を用いることで、エラスティック・ネット正則化コックス回帰と比較して、5% の絶対的 CI の向上を達成した。
  • シグモイド活性化関数を用いた場合でも、同じベースラインと比較して CI が 3% 向上し、活性化関数の種類に関わらず一貫した向上が確認された。
  • ランダム生存森は高次元ゲノムデータにおいて著しく性能を発揮せず、この文脈ではスケーラビリティと適応性に限界があることが示された。
  • 浅いネットワーク(各層 250 ニューロンの全結合層を 2 層)が、より深いアーキテクチャーよりも優れた性能を示した。これは、トレーニングサンプル数が限られている(n=628)ことと、ラベルの不足が要因であると考えられる。
  • ベイズ最適化により、効率的なハイパーパramータチューニングが可能となり、最適な設定として、事前学習の学習率が 0.001、ファインチューニングの学習率が 0.0009 であった。
  • 10 回の交差検証の平均 CI は、安定した一般化性能を示しており、誤差棒から結果の分散が小さいことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。