Skip to main content
QUICK REVIEW

[論文レビュー] TREEOME: A framework for epigenetic and transcriptomic data integration to explore regulatory interactions controlling transcription

David Budden, Daniel Hurley|arXiv (Cornell University)|Feb 5, 2015
Epigenetics and DNA Methylation参考文献 22被引用数 7
ひとこと要約

TREEOME は、遺伝子レベルの DNA メチル化およびヒストン修飾データを統合し、遺伝子を規制クラスに分類することで、条件的かつ相乗的なエピジェネティック相互作用をモデル化する意思決定木ベースのフレームワークである。これは、予測された対測定された転写産物豊度相関においてピアソンの積率相関係数 r > 0.70 を達成し、メチル化指標として平均部位メチル化割合(MMFS)を使用した場合、調整済み決定係数 R² が 0.06 向上する。

ABSTRACT

Motivation: Predictive modelling of gene expression is a powerful framework for the in silico exploration of transcriptional regulatory interactions through the integration of high-throughput -omics data. A major limitation of previous approaches is their inability to handle conditional and synergistic interactions that emerge when collectively analysing genes subject to different regulatory mechanisms. This limitation reduces overall predictive power and thus the reliability of downstream biological inference. Results: We introduce an analytical modelling framework (TREEOME: tree of models of expression) that integrates epigenetic and transcriptomic data by separating genes into putative regulatory classes. Current predictive modelling approaches have found both DNA methylation and histone modification epigenetic data to provide little or no improvement in accuracy of prediction of transcript abundance despite, for example, distinct anti-correlation between mRNA levels and promoter-localised DNA methylation. To improve on this, in TREEOME we evaluate four possible methods of formulating gene-level DNA methylation metrics, which provide a foundation for identifying gene-level methylation events and subsequent differential analysis, whereas most previous techniques operate at the level of individual CpG dinucleotides. We demonstrate TREEOME by integrating gene-level DNA methylation (bisulfite-seq) and histone modification (ChIP-seq) data to accurately predict genome-wide mRNA transcript abundance (RNA-seq) for H1-hESC and GM12878 cell lines. Availability: TREEOME is implemented using open-source software and made available as a pre-configured bootable reference environment. All scripts and data presented in this study are available online at http://sourceforge.net/projects/budden2015treeome/.

研究の動機と目的

  • 従来の予測モデルがエピジェネティックマーク間の条件的かつ相乗的相互作用を処理できないという限界を克服すること。
  • 遺伝子レベルの DNA メチル化およびヒストン修飾データを統合することで、転写産物豊度の予測を向上させるフレームワークの開発。
  • 予測モデリングに用いる最適な遺伝子レベル DNA メチル化指標を評価および同定すること。
  • TREEOME が H1-hESC および GM12878 細胞線で RNA-seq 表現を正確に予測する能力を示すこと。
  • エピジェネティックプロファイルに基づいて生物学的に意味のある無教師分類により、遺伝子を規制クラスに分類することを可能にすること。

提案手法

  • エピジェネティック特徴に基づいて遺伝子を仮想的規制クラスに分類する意思決定木ベースの分析フレームワーク(TREEOME)を用いる。
  • 4 つの遺伝子レベル DNA メチル化指標(MMFS、MMS、MPM、MPMF)を用いてプロモーター局在メチル化を定量し、その予測能を評価する。
  • H3K4me3、H3K27me3、H3K9me3、および H2A.Z の ChIP-seq データを統合し、文脈に依存する規制相互作用をモデル化する。
  • 無教師閾値選択を適用して規制クラスを定義し、純粋に統計最適化するのではなく生物学的解釈可能性を保持する。
  • 各規制クラス内で線形回帰モデルを用いて統合エピジェネティック特徴から転写産物豊度を予測する。
  • 予測された値と測定された RNA-seq 表現との間のピアソン相関係数(r)および調整済み決定係数 R² を用いてモデル性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1どの遺伝子レベル DNA メチル化指標が転写産物豊度と最も相関し、予測モデルの精度を向上させるか?
  • RQ2エピジェネティック特徴に基づいて遺伝子を規制クラスに分けることで、転写産物豊度の予測が向上するか?
  • RQ3ヒストン修飾(例:H3K4me3、H3K27me3、H2A.Z)間の条件的相互作用は、転写出力にどのように影響するか?
  • RQ4複雑なクロマチン調節が存在する中で、DNA メチル化データを統合することで、転写産物豊度予測の正確性はどの程度向上するか?
  • RQ5TREEOME は、文脈依存的な転写的効果を示す H2A.Z を有する遺伝子における規制の多様性を解明できるか?

主な発見

  • 平均部位メチル化割合(MMFS)指標は、H1-hESC および GM12878 細胞線の両方で遺伝子発現レベルと最も強い逆相関を示した。
  • MMFS を使用した場合、TREEOME は調整済み決定係数 R² を Δadj.R² = 0.06 向上させ、予測対測定転写産物豊度相関においてピアソンの積率相関係数 r > 0.70 を達成した。
  • H2A.Z− の遺伝子では予測精度が顕著に高く、H2A.Z+ の遺伝子では精度が低く、規制の多様性が原因と考えられる。
  • このフレームワークは、bisulfite-seq(DNA メチル化)、ChIP-seq(ヒストン修飾)、RNA-seq(転写産物豊度)データを統合し、ゲノムワイドな予測を実現した初の例である。
  • 遺伝子を規制クラスに分けることで、H3K4me3 の文脈依存的役割(H2A.Z や H3K27me3 の有無に応じて)のような条件的かつ相乗的相互作用をモデル化できた。
  • TREEOME は、メチル化と非メチル化遺伝子に対してそれぞれ異なる規制的役割と信頼性値を導出可能にし、予測ワークフローにおける生物学的解釈可能性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。