Skip to main content
QUICK REVIEW

[論文レビュー] The Mystery of Two Straight Lines in Bacterial Genome Statistics

Alexander N. Gorban, Andreï Zinovyev|arXiv (Cornell University)|Dec 9, 2004
Genomics and Phylogenetic Studies被引用数 1
ひとこと要約

本稿は、細菌および古細菌ゲノムが9次元のコドン位置特異的塩基頻度空間において2つの明確な直線を示すことを明らかにした。エウバクテリアと古細菌はそれぞれ別々の直線を形成する。主成分分析および平均場近似モデルを用いて、ゲノムのG+C含有量と最適成長温度が最初の2つの主成分を説明していることが示された。一方、平均場近似の曲率が3番目の主成分に現れる変動を説明しており、コドン使用頻度の変動の71.6%が最初の3つの主成分で説明可能である。

ABSTRACT

In special coordinates (codon position-specific nucleotide frequencies), bacterial genomes form two straight lines in 9-dimensional space: one line for eubacterial genomes, another for archaeal genomes. All the 348 distinct bacterial genomes available in Genbank in April 2007, belong to these lines with high accuracy. The main challenge now is to explain the observed high accuracy. The new phenomenon of complementary symmetry for codon position-specific nucleotide frequencies is observed. The results of analysis of several codon usage models are presented. We demonstrate that the mean-field approximation, which is also known as context-free, or complete independence model, or Segre variety, can serve as a reasonable approximation to the real codon usage. The first two principal components of codon usage correlate strongly with genomic G+C content and the optimal growth temperature, respectively. The variation of codon usage along the third component is related to the curvature of the mean-field approximation. First three eigenvalues in codon usage PCA explain 59.1%, 7.8 % and 4.7 % of variation. The eubacterial and archaeal genomes codon usage is clearly distributed along two third order curves with genomic G+C content as a parameter.

研究の動機と目的

  • コドン位置特異的塩基頻度を用いて、細菌および古細菌ゲノムのコドン使用頻度パターンに潜む構造を調査すること。
  • GenBank(2007年4月)に登録された348個の細菌ゲノムが9次元空間で2つの明確な直線に非常に高い精度で並ぶ理由を解明すること。
  • 平均場近似(文脈フリー・モデル)が、現実のコドン使用頻度パターンを妥当に表現できるかどうかを評価すること。
  • 主にG+C含有量と最適成長温度を含む生物学的要因が、コドン使用頻度の主な変動を引き起こしているかどうかを特定すること。

提案手法

  • GenBank(2007年4月)に登録された348個の細菌ゲノムを、コドン位置特異的塩基頻度を用いて9次元空間にマッピングすること。
  • コドン使用頻度の主な変動軸を特定するために主成分分析(PCA)を適用すること。
  • 独立したコドン位置頻度が観察されたパターンをどれだけうまく予測できるかを評価するために、平均場近似(Segre多様体モデル)を用いること。
  • 3番目の主成分に現れる変動を説明するために、平均場近似の曲率を分析すること。
  • 最初の2つの主成分とゲノムのG+C含有量および最適成長温度の相関を分析すること。
  • エウバクテリアおよび古細菌ゲノムが、G+C含有量をパラメータとする2つの別々の3次曲線に従うという仮説を検証すること。

実験結果

リサーチクエスチョン

  • RQ1なぜエウバクテリアおよび古細菌ゲノムが、9次元のコドン位置特異的塩基頻度空間において非常に高い精度で2つの別々の直線を形成するのか?
  • RQ2平均場近似モデルが、細菌ゲノムの現実のコドン使用頻度パターンをどの程度うまく説明できるのか?
  • RQ3G+C含有量と最適成長温度を含む生物学的要因の中で、コドン使用頻度変動の最初の2つの主成分を主に決定するのはどれか?
  • RQ43番目の主成分に現れる変動は、平均場近似の曲率とどのように関係しているのか?
  • RQ5エウバクテリアおよび古細菌のコドン使用頻度パターンは、ゲノムのG+C含有量をパラメータとする2つの別々の3次曲線で最もよく記述できるのか?

主な発見

  • GenBank(2007年4月)に登録された348個の細菌ゲノムが、9次元のコドン位置特異的塩基頻度空間において、エウバクテリア用と古細菌用の2つの明確な直線に非常に高い精度で並んでいる。
  • コドン使用頻度の最初の2つの主成分は、それぞれ全変動の59.1%および7.8%を説明しており、ゲノムのG+C含有量および最適成長温度と強く相関している。
  • 3番目の主成分は変動の4.7%を説明し、平均場近似の曲率に関連している。
  • 平均場近似(文脈フリー・モデル)は、現実のコドン使用頻度を妥当に近似しており、コドン位置の独立性がゲノム構造の主要な特徴を捉えている可能性を示唆している。
  • エウバクテリアおよび古細菌のコドン使用頻度パターンは、ゲノムのG+C含有量をパラメータとする2つの別々の3次曲線に従って分布している。
  • 最初の3つの主成分が合わせて、解析されたゲノム全体のコドン使用頻度の全変動の71.6%を説明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。