Skip to main content
QUICK REVIEW

[論文レビュー] Computational identification of transcription factor binding sites by functional analysis of sets of genes sharing overrepresented upstream motifs

Davide Corà, Ferdinando Di Cunto|ArXiv.org|Oct 31, 2003
Genomics and Chromatin Dynamics参考文献 20被引用数 12
ひとこと要約

本論文は、上流遺伝子領域における過剰に出現するモチーフを同定し、Gene Ontology (GO) 項目の機能的豊富度を用いて検証することで、転写因子結合部位を計算的手法で特定する方法を提案している。過剰に出現するモチーフを共有する遺伝子をグループ化し、GO 項目における有意な豊富度をテストすることで、*S. cerevisiae* において既知および未知の調節要素を同定する。有意性は経験的ランダム化を用いて偽発見率(FDR)を制御し、発現データのみに依存する手法よりも信頼性が向上する。

ABSTRACT

BACKGROUND: Transcriptional regulation is a key mechanism in the functioning of the cell, and is mostly effected through transcription factors binding to specific recognition motifs located upstream of the coding region of the regulated gene. The computational identification of such motifs is made easier by the fact that they often appear several times in the upstream region of the regulated genes, so that the number of occurrences of relevant motifs is often significantly larger than expected by pure chance. RESULTS: To exploit this fact, we construct sets of genes characterized by the statistical overrepresentation of a certain motif in their upstream regions. Then we study the functional characterization of these sets by analyzing their annotation to Gene Ontology terms. For the sets showing a statistically significant specific functional characterization, we conjecture that the upstream motif characterizing the set is a binding site for a transcription factor involved in the regulation of the genes in the set. CONCLUSIONS: The method we propose is able to identify many known binding sites in S. cerevisiae and new candidate targets of regulation by known transcription factors. Its application to less well studied organisms is likely to be valuable in the exploration of their regulatory interaction network.

研究の動機と目的

  • 発現データに依存せず、機能アノテーションを活用することで、転写因子結合部位の計算的同定を改善すること。
  • マイクロアレイベースの検証における限界、例えば実験的バイアスや小規模な遺伝子群に対する感度の低さを解消すること。
  • Gene Ontology (GO) 項目の豊富度を検証基準として用いることで、生物学的に意味のある調節モチーフを検出する強固な手法を開発すること。
  • ランダム化された遺伝子セットを用いた経験的推定により、モチーフ-遺伝子関連の偽陽性を制御すること。
  • 発現データが限られているまたは利用できないような、あまり研究が進んでいない生物に対しても、本手法を一般化し、機能的検証フレームワークを提供すること。

提案手法

  • 5〜8塩基のすべてのモチーフについて、その上流領域に背景頻度と比較して顕著に過剰に出現するモチーフを有する遺伝子を、モチーフ別に遺伝子群にグループ化する。
  • 各モチーフ-遺伝子群の機能的特徴付けは、超幾何分布を用いた有意なGO 項目の豊富度をテストすることで行う。
  • 偽発見率(FDR)は、典型的なサイズ(20遺伝子)の350万個のランダム遺伝子セットを生成し、GO ブランチごとの最良P値の分布を計算することで経験的に推定する。
  • FDRは、ランダムセットからの予想される偽発見数と観察された有意関連数の比として計算され、統計的信頼性のためのカットオフ選択が可能になる。
  • 本手法は2段階の検証を用いる:まずモチーフの過剰出現、次にGO 項目の豊富度による機能的一致性の確認であり、マイクロアレイデータに依存しない。
  • 本手法は *S. cerevisiae* に適用され、文献(例:Ref. [5])に記載された既知の転写因子-遺伝子相互作用と比較されている。

実験結果

リサーチクエスチョン

  • RQ1Gene Ontology 項目の機能的豊富度は、計算的に同定された転写因子結合モチーフの信頼できる検証として機能するか?
  • RQ2数千のモチーフとGO 項目を同時にテストする際、偽陽性のモチーフ-遺伝子関連をどのように制御できるか?
  • RQ3GOに基づく検証は、実験的制限により発現ベースの手法が見逃す調節モチーフを検出できるか?
  • RQ4本手法は、*S. cerevisiae* のような機能的アノテーションが整ったモデル生物において、既知および未知の調節要素をどの程度同定できるか?
  • RQ5本手法は、発現データが限られているまたは利用できないような、あまり研究が進んでいない生物に対しても一般化可能か?

主な発見

  • 本手法は、モチーフ関連遺伝子群におけるGO 項目の有意な機能的豊富度を用いて、*S. cerevisiae* における多くの既知の転写因子結合部位を効果的に同定した。
  • 過剰に出現するモチーフと一貫した生物学的機能を結びつけることで、既知の転写因子の新たな候補調節標的を同定した。
  • 経験的ランダム化を用いることで、偽発見率を0.01に制御し、同定されたモチーフ-遺伝子関連に高い信頼性を確保した。
  • GOに基づく検証は発現ベースの手法を補完・拡張し、特にマイクロアレイ信号が弱い小規模または機能的一致性の高い遺伝子群において有効である。
  • 本手法はさまざまな遺伝子群サイズに対して頑健であり、シミュレーションにより、選択された遺伝子群サイズに関わらず一貫したFDR推定値が得られた。
  • 文献(Ref. [5])に記載された実験的に同定された転写因子標的と比較した体系的分析では、有意なGO 項目の豊富度を示すモチーフ-遺伝子群が、既知のTF調節遺伝子と顕著に一致しており(多くの場合P < 10⁻⁵)、高い有意性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。