Skip to main content
QUICK REVIEW

[論文レビュー] Deep Recurrent Neural Networks for Sequential Phenotype Prediction in Genomics

Farhad Pouladi, Hojjat Salehinejad|arXiv (Cornell University)|Nov 9, 2015
Gene expression and cancer classification参考文献 25被引用数 4
ひとこと要約

本論文は、遺伝子型補完とRNNを用いた長期依存関係のモデル化を組み合わせることで、ゲノムにおける逐次的表現型予測のための新規ReLUベースの学習戦略を有する深層再帰ニューラルネットワーク(DRNN)を提案する。604人の個体、1980個のSNP、2つの表現型を含むデータセットにおいて、ReLU-RNNは訓練精度と計算効率の両面でLSTM-RNNおよびSRNNを上回った。

ABSTRACT

In analyzing of modern biological data, we are often dealing with ill-posed problems and missing data, mostly due to high dimensionality and multicollinearity of the dataset. In this paper, we have proposed a system based on matrix factorization (MF) and deep recurrent neural networks (DRNNs) for genotype imputation and phenotype sequences prediction. In order to model the long-term dependencies of phenotype data, the new Recurrent Linear Units (ReLU) learning strategy is utilized for the first time. The proposed model is implemented for parallel processing on central processing units (CPUs) and graphic processing units (GPUs). Performance of the proposed model is compared with other training algorithms for learning long-term dependencies as well as the sparse partial least square (SPLS) method on a set of genotype and phenotype data with 604 samples, 1980 single-nucleotide polymorphisms (SNPs), and two traits. The results demonstrate performance of the ReLU training algorithm in learning long-term dependencies in RNNs.

研究の動機と目的

  • 遺伝子型データの欠損と逐次的表現型予測における長期依存関係の課題に対処すること。
  • 高次元かつ多重共線性を示すゲノムデータに対する深層学習を用いて、複雑な疾患表現型の予測性能を向上させること。
  • 表現型系列における長期的時間的パターンをモデル化するためのLSTM-RNNの計算的に効率的な代替手法を開発すること。
  • 実世界のゲノムデータにおいて、SPLSや従来のRNNと同等の手法を比較して、提案手法を評価すること。
  • 再帰的ネットワークにおける新規なReLUベースの学習戦略がゲノム応用において有効であることを示すこと。

提案手法

  • F個の潜在的特徴を用いた低ランク近似を用いて、行列分解(MF)を適用し、欠損した遺伝子型データを補完する。
  • 補完された遺伝子型を入力として、逐次的表現型予測のための深層再帰ニューラルネットワーク(DRNN)を学習する。
  • 表現型系列における長期依存関係をよりよく捉えるために、RNNの学習に新規なReLUベースの戦略を導入する。
  • CPUおよびGPUを用いた並列処理を実装し、学習効率を向上させる。
  • 平均二乗誤差を損失関数として用い、ReLU-RNNを標準RNN(SRNN)および長短期記憶RNN(LSTM-RNN)と比較する。
  • 学習に80%のデータ、検証に10%、テストに10%のデータを割り当て、比較のためのベースラインとしてSPLSを用いる。

実験結果

リサーチクエスチョン

  • RQ1SPLSおよびSRNNと比較して、ReLUベースの学習戦略は、ゲノム表現型予測におけるRNNの長期依存関係学習を改善できるか?
  • RQ2行列分解は、後続の表現型予測タスクにおける欠損遺伝子型データの補完にどの程度効果的か?
  • RQ3提案されたReLUベースの学習戦略を有するDRNNは、実際のゲノムデータセットにおいてSPLSを上回る予測性能を達成できるか?
  • RQ4行列分解における潜在的特徴数と補完精度の間にはどのようなトレードオフがあるか?
  • RQ5ゲノム系列モデリングの文脈において、ReLU-RNNの計算複雑度はLSTM-RNNと比較してどの程度か?

主な発見

  • ReLU-RNNは、SRNN、LSTM-RNN、ReLU-RNNの中でも最小の訓練誤差を達成し、100エポック経過後に顕著な誤差低減を示した。
  • 1000個の潜在的特徴を用いた行列分解は、欠損遺伝子型の補完に72.48%の成功率を達成し、全遺伝子型行列の再構築には97.56%の精度を示した。
  • ReLU-RNNは、Trait 1で80.25%、Trait 2で78.29%のテスト相関を達成し、同じテストセットでSPLSが51.53%および56.42%を示したのに対し、優れた性能を発揮した。
  • ReLU-RNNは、SRNNおよびLSTM-RNNと比較して収束が早く、訓練誤差も低く抑えられており、長期依存関係の学習ダイナミクスに優れていることが示された。
  • MFにおける潜在的特徴数の増加は補完性能の向上をもたらしたが、700特徴を越えると効果の逓減が見られた。
  • ReLU-RNNは、LSTM-RNNと比較して計算複雑度が低く抑えられており、性能は同等またはそれを上回った。これは、大規模ゲノムデータに適した可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。