Skip to main content
QUICK REVIEW

[論文レビュー] Feature versus Raw Sequence: Deep Learning Comparative Study on Predicting Pre-miRNA

Jaya Thomas, Sonia Thomas|arXiv (Cornell University)|Oct 17, 2017
Genomics and Phylogenetic Studies参考文献 16被引用数 3
ひとこと要約

本研究では、前ミクロRNA(pre-miRNA)予測のための深層学習モデルにおいて、rawなmiRNA配列と特徴量を用いた手法を比較した。rawな配列を用いた6層の畳み込みニューラルネットワーク(CNN)は99.5%の正確性を達成し、20個の選択された特徴量を用いた3層の深層信念ネットワーク(DBN)の99.0%をわずかに上回った。これは、十分なデータが利用可能な場合、適切に設計されたraw配列モデルが特徴量ベースのアプローチを代替可能であることを示している。

ABSTRACT

Should we input known genome sequence features or input sequence itself in deep learning framework? As deep learning more popular in various applications, researchers often come to question whether to generate features or use raw sequences for deep learning. To answer this question, we study the prediction accuracy of precursor miRNA prediction of feature-based deep belief network and sequence-based convolution neural network. Tested on a variant of six-layer convolution neural net and three-layer deep belief network, we find the raw sequence input based convolution neural network model performs similar or slightly better than feature based deep belief networks with best accuracy values of 0.995 and 0.990, respectively. Both the models outperform existing benchmarks models. The results shows us that if provided large enough data, well devised raw sequence based deep learning models can replace feature based deep learning models. However, construction of well behaved deep learning model can be very challenging. In cased features can be easily extracted, feature-based deep learning models may be a better alternative.

研究の動機と目的

  • rawなRNA配列と事前に抽出された配列特徴量のどちらが、前ミクロRNA予測のための深層学習モデルにおいてより優れた性能を発揮するかを特定すること。
  • 生物学的に意味のある特徴量を用いた深層信念ネットワーク(DBN)と、直接ヌクレオチド配列に訓練された畳み込みニューラルネットワーク(CNN)の有効性を評価すること。
  • SVM、ランダムフォレスト、ナイーブベイズ分類器といった既存のベンチマーク手法と比較して、これらの深層学習モデルの性能を評価すること。
  • raw配列からのエンドツーエンド学習が、前ミクロRNA分類における手動による特徴量設計の必要性を排除できるかどうかを調査すること。

提案手法

  • フィルターサイズ18、ストライド4、20個のフィルターを用い、6層の畳み込みニューラルネットワーク(CNN)をrawヌクレオチド配列で訓練。その後、90および2個のニューロンを有する2つの全結合層を配置。
  • 2つの畳み込み層(フィルターサイズ12および6、ストライド1)を有する2番目のCNNアーキテクチャを実装。その後、最大プーリング(ウィンドウサイズ6、ストライド4)を実施し、2つの全結合層を経て2ニューロンの出力層に接続。
  • 両方のCNNモデルにおいて、過学習を防ぐために出力層でドロップアウト比0.3を適用。
  • 自由エネルギー、融解温度、塩基対形成統計量を含む58および20個の生物学的に意味のある特徴量を用いて、3層の隠れ層(100、70、35ニューロン)を持つ深層信念ネットワーク(DBN)を構築。
  • 確率的要因を考慮し、DBNモデルに対して20回の独立した実行を実施し、安定性を確保するため平均化処理を実施。
  • 正解率、F1スコアを用いてモデルを評価し、SVM、MiRANN、Triplet-SVMといった既存手法と比較した。

実験結果

リサーチクエスチョン

  • RQ1手作業で作成された配列特徴量を用いたモデルと比較して、rawなRNA配列に直接訓練された深層学習モデルが、前ミクロRNA予測において優れた性能を発揮するか?
  • RQ2異なる特徴量サブセットにおいて、raw配列を用いたCNNと特徴量セットを用いたDBNの性能指標(正解率、F1スコア)はどのように比較されるか?
  • RQ3raw配列ベースの深層学習モデルは、SVM やランダムフォレストといった従来の機械学習手法よりも高い正確性を達成できるか?
  • RQ4限られた生物学的配列データを用いた学習において、モデルの深さやアーキテクチャ設計が性能に与える影響は何か?

主な発見

  • raw配列に基づく6層のCNNは、0.995の最高正解率を達成し、特徴量ベースのDBNモデルを顕著に上回った。
  • 20個の選択された特徴量を用いて訓練されたDBNモデルは、0.990の正解率を達成した。これは58個の特徴量を用いた0.968の正解率よりもわずかに高い。
  • 両方の深層学習モデル(CNNおよびDBN)は、SVM、ナイーブベイズ、ランダムフォレストといった既存のベンチマーク手法をすべて上回った。
  • 2つの畳み込み層(フィルターサイズ12および6、ストライド1)を有するCNNモデルは、最大プーリングを経て高い性能を発揮した。これは、より深いアーキテクチャが特徴抽出を強化できることを示している。
  • raw配列モデルの可能性は大きいが、データ制限やハイパーパramータの感受性のため、良好な深層学習アーキテクチャを構築することは依然として挑戦的である。
  • 高品質で容易に抽出可能な特徴量が利用可能な場合、特徴量ベースのDBNは、その頑健性と低いアーキテクチャの複雑さのため、依然として好ましい代替手段である可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。