Skip to main content
QUICK REVIEW

[論文レビュー] Attention based convolutional neural network for predicting RNA-protein binding sites

Xiaoyong Pan, Junchi Yan|arXiv (Cornell University)|Dec 6, 2017
RNA and protein synthesis mechanismsBiochemistry, Genetics and Molecular Biology参考文献 2被引用数 20
ひとこと要約

本論文では、生のRNA配列を用いてRNA-タンパク質結合部位を予測するアテンションベースの畳み込みニューラルネットワーク、iDeepAを提案する。1次元CNNと二重レベルのアテンション機構(配列次元および特徴マップ次元)を統合することで、特徴学習とモチーフ局在化が向上し、24種のRBPを対象としたCLIP-seqベンチマークデータ上でSOTAのAUC 0.921を達成した。特に小規模データセットにおいて顕著な改善が見られた。

ABSTRACT

RNA-binding proteins (RBPs) play crucial roles in many biological processes, e.g. gene regulation. Computational identification of RBP binding sites on RNAs are urgently needed. In particular, RBPs bind to RNAs by recognizing sequence motifs. Thus, fast locating those motifs on RNA sequences is crucial and time-efficient for determining whether the RNAs interact with the RBPs or not. In this study, we present an attention based convolutional neural network, iDeepA, to predict RNA-protein binding sites from raw RNA sequences. We first encode RNA sequences into one-hot encoding. Next, we design a deep learning model with a convolutional neural network (CNN) and an attention mechanism, which automatically search for important positions, e.g. binding motifs, to learn discriminant high-level features for predicting RBP binding sites. We evaluate iDeepA on publicly gold-standard RBP binding sites derived from CLIP-seq data. The results demonstrate iDeepA achieves comparable performance with other state-of-the-art methods.

研究の動機と目的

  • 生のRNA配列からRNA-タンパク質結合部位を正確に予測する深層学習モデルの開発。
  • 生物学的に関連する配列モチーフに注目できるアテンション機構を組み込むことで、モデルの解釈可能性と性能の向上。
  • アテンションによる特徴学習の強化により、既存手法が小規模な学習データセットで抱える限界を克服すること。
  • 24種のRBPを対象とした大規模かつゴールドスタンダードのCLIP-seqデータセット上でモデルを評価すること。

提案手法

  • RNA配列は、ヌクレオチドの存在(A, C, G, U)を表すone-hot行列に符号化される。
  • 1次元CNNがone-hot行列を処理し、畳み込み、ReLU活性化関数、およびマックスプーリングを適用して階層的特徴を抽出する。
  • 2つのアテンション機構が適用される:1つは時間ステップ(配列次元)に沿ったもの、もう1つは転置された隠れ状態を介した特徴マップ次元に沿ったもの。
  • アテンション重みは、ソフトアテンションスコアを生成する全結合ネットワークにより計算され、$ \alpha_t = \frac{\exp(e_t)}{\sum_i \exp(e_i)} $ であり、コンテキストベクトルは $ O = \sum_t h_t \alpha_t $ である。
  • CNNおよび2つのアテンション層からの出力を連結し、2つの全結合層(シグモイド活性化関数を伴う)を通過させて二値分類を行う。
  • モデル学習には、30エポックにわたりRMSProp最適化法を用いたカテゴリカル交差エントロピー損失関数が使用される。

実験結果

リサーチクエスチョン

  • RQ1アテンション拡張CNNは、標準的なCNNと比較して、生物学的に関連するRNA-タンパク質結合モチーフの同定を改善できるか?
  • RQ2アテンション機構は、限られた学習データを持つRBPにおいて性能向上をもたらすか?
  • RQ3多様なRBPを対象としたAUCの観点で、iDeepAはDeepBind や GraphProt といったSOTA手法と比較してどのように異なるか?
  • RQ4アテンション機構は、解釈可能性を高めるために、RNA配列内の機能的に重要な部分配列を局在化できるか?

主な発見

  • iDeepAは24種のRBP実験において平均AUC 0.921を達成し、DeepBindと同等の性能を示し、GraphProt(0.887)およびdeepnet-rbp(0.902)を上回った。
  • 学習サンプルが4,000個しかないRBP C17ORF85において、iDeepAはAUC 0.839を達成し、DeepBindの0.755から11%の改善を示した。
  • アテンション機構により、小規模データセットでも学習効率が向上し、重要なモチーフに焦点を当てたより良い一般化性能が示唆された。
  • MILCNNは、固定長の部分配列に配列を分割するため、結合部位が破壊される可能性があるため、性能が劣った。
  • SOTA手法と同等の性能を示したため、多様なRBPデータセットにおいて、本モデルの堅牢性とスケーラビリティが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。