[論文レビュー] A multi-modal neural network for learning cis and trans regulation of stress response in yeast
本論文は、ストレス応答性イーストにおける遺伝子発現を予測するために、原始的な cis-Regulatory DNA配列と trans-Regulatorの発現レベルを統合するマルチモーダル深層ニューラルネットワークを提案する。このモデルは、特徴量として設計されたモチーフを用いた最先端手法を上回り、既知および新規の調節モチーフを学習し、in-silico TFノックアウト効果を正確に予測する。実際のマイクロアレイデータとのスピアマン相関係数は 0.486 を示した。
Deciphering gene regulatory networks is a central problem in computational biology. Here, we explore the use of multi-modal neural networks to learn predictive models of gene expression that include cis and trans regulatory components. We learn models of stress response in the budding yeast Saccharomyces cerevisiae. Our models achieve high performance and substantially outperform other state-of-the-art methods such as boosting algorithms that use pre-defined cis-regulatory features. Our model learns several cis and trans regulators including well-known master stress response regulators. We use our models to perform in-silico TF knock-out experiments and demonstrate that in-silico predictions of target gene changes correlate with the results of the corresponding TF knockout microarray experiment.
研究の動機と目的
- cis-Regulatory DNA配列と trans-Regulatorの発現レベルの両方を統合する、イーストにおける遺伝子発現の予測モデルの開発。
- 事前に定義された不完全なモチーフアノテーションに依存する既存のモデルの限界を克服し、原始的な配列データからde novoで調節特徴を学習する。
- 位置スコア行列などの特徴量として設計された特徴を用いた最先端手法と比較して、モデルの性能をベンチマーク化する。
- in-silico パーティクルスの効果を予測し、実験的マイクロアレイデータと比較することで、モデルの生物学的妥当性を検証する。
- 勾配ベースの重要度スコアリングなどの解釈可能性技術を用いて、ストレス応答に関与する主要な cis および trans 調節因子を同定する。
提案手法
- cis および trans 調節入力を別々のブランチで処理するマルチモーダルニューラルネットワークアーキテクチャを採用:1-kbプロモーター配列(one-hotエンコーディング)と trans 要因発現レベル(472種類の調節因子)。
- 2層の9フィルターコンボリューショナル層(各50フィルタ)を備えたコンボリューショナルシーケンスモジュール、ReLU活性化関数、バッチ正規化、最大プーリング(4x4)、パラメータ共有によるリバースコンplementデータオーグメンテーションを実装。
- trans 調節因子発現ベクトルを高次元特徴に変換するため、512ユニットの全結合層を適用。
- cis および trans の表現を連結して統合し、2層の全結合層(各512ユニット)を経て、回帰用の線形出力層または分類用のソフトマックス層を出力に接続。
- 確率的勾配降下法を用いて訓練し、学習率の徐々な低下を適用。回帰タスクでは平均二乗誤差、分類タスクでは交差エントロピー損失を最適化対象とする。
- log2倍差変化の閾値に基づき、遺伝子発現を3クラス(-1, 0, 1)に離散化して分類タスクに適用。
実験結果
リサーチクエスチョン
- RQ1原始的なDNA配列と trans 要因発現から学習する深層学習モデルは、事前に定義された転写因子モチーフ特徴を用いたモデルを上回り、遺伝子発現を予測する能力に優れるか?
- RQ2モデルが学習する cis-Regulatory 配列パターンは、既知または新規の転写因子結合モチーフに対応しているか?
- RQ3多様なストレス条件下で、遺伝子発現変化を最も予測的に示す trans 調節因子は何か?
- RQ4in-silico パーティクルスによる転写因子ノックアウト効果を、モデルはどの程度正確に予測できるか?
- RQ5in-silico での予測と実際の実験的ノックアウトマイクロアレイデータとの相関度はどの程度か?
主な発見
- 回帰タスクにおいて、テストセットのピアソン相関係数が 0.845 を達成し、以前の最先端手法を顕著に上回った。
- 分類タスクでは79.5%の精度を達成し、GeneClass(60.9%)およびBDTree(62.9%)を16ポイント以上上回った。
- モデルは、DOT6P、RPN4P、SFP1P、STB3P、MSN2/4 といった既知のストレス応答モチーフに加え、新規のde novoモチーフをも回復した。
- 勾配ベースの重要度スコアリングにより同定された上位の trans 調節因子には、USV1、DAL80、XBP1、PPT1、YVH1、TPK1、MSN4 が含まれる。これらは多くが既知のストレス応答調節因子である。
- in-silico での MSN2/4 ノックアウトでは、予測された発現変化が実際のマイクロアレイデータと相関し(スピアマン相関係数 = 0.486)、妥当性が裏付けられた。
- モデルは文脈特異的な予測能力を示し、ヒートショック条件下ではステディステート条件よりも標的遺伝子の発現変化が顕著に大きかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。