Skip to main content
QUICK REVIEW

[論文レビュー] Seven clusters in genomic triplet distributions

Alexander N. Gorban, Andreï Zinovyev|PubMed|May 29, 2003
Genomics and Phylogenetic Studies参考文献 14被引用数 18
ひとこと要約

この論文は、複数のゲノムにおけるトリプレット頻度の分布に一貫した七クラスタ構造が存在することを、ゲノム配列のスライディングウインドウ解析を用いて同定した。クラスタは3つのリーディングフレーム(前方および逆鎖)のタンパク質コード領域と非コード領域に対応し、事前の遺伝子アノテーションやORF抽出を必要とせず、アセンブルされていないゲノムにおいても90%以上のヌクレオチドレベルの正確性で教師なし遺伝子検出を可能にする。

ABSTRACT

In several recent papers new gene-detection algorithms were proposed for detecting protein-coding regions without requiring a learning dataset of already known genes. The fact that unsupervised gene-detection is possible is closely connected to the existence of a cluster structure in oligomer frequency distributions. In this paper we study the cluster structure of several genomes in the space of their triplet frequencies, using a pure data exploration strategy. Several complete genomic sequences were analyzed, using the visualization of tables of triplet frequencies in a sliding window. The distribution of 64-dimensional vectors of triplet frequencies displays a well-detectable cluster structure. The structure was found to consist of seven clusters, corresponding to protein-coding information in three possible phases in one of the two complementary strands and in the non-coding regions with high accuracy (higher than 90% on nucleotide level). Visualizing and understanding the structure allows to analyze effectively the performance of different gene-prediction tools. Since the method does not require extraction of ORFs, it can be applied even for unassembled genomes.

研究の動機と目的

  • 複数の完全ゲノムにわたるゲノムトリプレット頻度分布における内在的なクラスタ構造を調査すること。
  • このようなクラスタ構造が、既知の遺伝子の知識なしにタンパク質コード領域の教師なし検出を可能にするかを同定すること。
  • アセンブル済みおよびアセンブルされていないゲノム配列において、トリプレット頻度パターンを単独の手法として遺伝子予測に用いる可能性を評価すること。
  • 平均場モデルの情報含量と、観察されたクラスタ構造を説明する有効性を分析すること。

提案手法

  • 全ゲノム配列の全可能なトリプレット(トリプレット)について、64次元の頻度ベクトルをスライディングウインドウ法で計算した。
  • 純粋なデータ探索と可視化技術を用い、高次元空間におけるトリプレット頻度分布をマップした。
  • 3つの前方リーディングフレーム、3つの逆鎖リーディングフレーム、非コード領域に対応する安定した七クラスタ構造を同定・検証した。
  • ヌクレオチドレベルでのクラスタ割り当ての正確性を評価し、90%を超える正答率を達成した。
  • トリプレット分布の情報含量を評価し、平均場モデルが観察されたパターンを説明する一貫性をテストした。
  • 再現性およびさらなる分析のため、ソフトウェアおよびデータセットを公開した。

実験結果

リサーチクエスチョン

  • RQ1多様なゲノムにわたるトリプレット頻度空間に一貫したクラスタ構造が存在するか?
  • RQ2このクラスタ構造を用いて、既知の遺伝子の学習なしにタンパク質コード領域を検出できるか?
  • RQ3特にコード領域と非コード領域を区別する際、ヌクレオチドをクラスタに割り当てる正確性はどの程度か?
  • RQ43つのリーディングフレームにおける前方鎖と逆鎖の間で、トリプレット頻度パターンにどのような差が生じるか?
  • RQ5平均場モデルは、観察されたトリプレット頻度の分布パターンをどの程度説明できるか?

主な発見

  • 解析された複数のゲノムにおいて、トリプレット頻度空間に一貫して強い七クラスタ構造が観察された。
  • 七クラスタは、3つの前方リーディングフレーム、3つの逆鎖リーディングフレーム、非コード領域に正確に対応しており、ヌクレオチドレベルで90%以上の正確性を示した。
  • クラスタ構造により、オープンリーディングフレーム(ORF)の抽出や既知の遺伝子の知識なしに教師なし遺伝子検出が可能になった。
  • この手法はアセンブルされていないゲノムにも適用可能であり、ドラフトまたは断片化された配列データに適している。
  • トリプレット分布の情報含量は、ゲノム配列に非ランダムで生物学的に意味のあるパターンが存在することを支持する。
  • 平均場モデルは、観察された分布パターンを説明する上で有効であることが判明し、背後にある統計的規則性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。