[論文レビュー] Automation on the generation of genome scale metabolic models
本論文では、COPABIプラットフォームに実装された自動化パイプラインを提示する。このパイプラインは、確率的アルゴリズムを用いてゲノム、プロテオーム、メタボロームデータからゲノムスケール代謝モデル(GSMs)を生成する。ネットワーク距離指標を用いた分析により、手動でcuratedされたモデルと高い一貫性を示しており、モデル再構築に要する時間を約1年から数日間へと短縮した。また、接続性やスモールワールド行動といった重要なネットワーク特性を保持している。
Background: Nowadays, the reconstruction of genome scale metabolic models is a non-automatized and interactive process based on decision taking. This lengthy process usually requires a full year of one person's work in order to satisfactory collect, analyze and validate the list of all metabolic reactions present in a specific organism. In order to write this list, one manually has to go through a huge amount of genomic, metabolomic and physiological information. Currently, there is no optimal algorithm that allows one to automatically go through all this information and generate the models taking into account probabilistic criteria of unicity and completeness that a biologist would consider. Results: This work presents the automation of a methodology for the reconstruction of genome scale metabolic models for any organism. The methodology that follows is the automatized version of the steps implemented manually for the reconstruction of the genome scale metabolic model of a photosynthetic organism, {\it Synechocystis sp. PCC6803}. The steps for the reconstruction are implemented in a computational platform (COPABI) that generates the models from the probabilistic algorithms that have been developed. Conclusions: For validation of the developed algorithm robustness, the metabolic models of several organisms generated by the platform have been studied together with published models that have been manually curated. Network properties of the models like connectivity and average shortest mean path of the different models have been compared and analyzed.
研究の動機と目的
- 通常1つの生物に対して約1年を要する、長期間にわたる手作業によるゲノムスケール代謝モデルの再構築プロセスを解決すること。
- ゲノム、プロテオーム、メタボロームデータを統合し、一元的な代謝ネットワーク再構築を実現する自動的かつスケーラブルな手法を開発すること。
- 自動生成されたモデルの頑健性と正確性を、既に発表済みの手動でcuratedされたモデルと比較して検証すること。
- 計算プラットフォームを用いて、任意の生物に対して迅速かつ再現可能で一貫性のあるGSM生成を可能にすること。
- システム生物学および合成生物学の応用を支援するため、信頼性の高い代謝モデルへのアクセスを加速すること。
提案手法
- 本手法は、COPABIという計算プラットフォームを用い、KEGGデータベースからゲノム、プロテオーム、メタボローム情報を自動的に取得・統合する。
- 反応の独自性と完全性を評価するために確率的アルゴリズムを適用し、生物学的妥当性に基づいたモデル構築を支援する。
- 再構築されたモデルは、後続の解析用に標準フォーマット(OptGeneおよびSBML/xml)でエクスポートされる。
- ネットワークのトポロジーを特徴付けるために、接続性や平均最短経路などのネットワーク特性が計算される。
- 代謝物セットの重複度と接続重みに基づいて定義されたネットワーク距離指標を用い、自動生成モデルと手動でcuratedされたモデルとの比較が可能になる。
- 距離指標は、dist = (α + β)/(2γ) として計算され、ここでα、β、γはネットワーク間の代謝物セットにおける重み付き接続割合を表す。
実験結果
リサーチクエスチョン
- RQ1完全に自動化されたパイプラインは、手動でcuratedされたモデルと整合性のあるゲノムスケール代謝モデルを生成できるか?
- RQ2自動生成モデルのトポロジー的特性(例:接続性、平均最短経路)は、手動でcuratedされたモデルと比較してどのように異なるか?
- RQ3自動生成モデルは、スモールワールドおよびスケールフリーネットワーク特性といった、重要なネットワーク特徴をどの程度保持しているか?
- RQ4代謝物セットの重なりと接続パターンに基づく距離指標は、異なる生物のモデルを信頼性高く区別できるか?
- RQ5自動化により、手動によるcuratedと比較して代謝モデル再構築に要する時間と作業量はどの程度短縮されるか?
主な発見
- 自動生成モデルは、ネットワーク距離指標の分析により、手動でcuratedされたモデルと高い一貫性を示しており、同じ生物のモデル同士を比較した際に最大の距離値が得られている。
- 表2の各行において、最大の距離値が自身の文献モデルとの比較に対応しており、モデルの正確性が確認された。
- 自動生成モデルの平均最短経路および接続性の分布は、スモールワールドおよびスケールフリーのネットワーク行動を示しており、既知の生物学的ネットワーク特性と整合的である。
- 定義されていないバイオマスや正確な代謝物名のマッピングの欠如といった制限は存在するが、モデルは十分な構造的特徴を保持しており、異なる生物間の区別が可能である。
- 本手法により、再構築時間は約1年から数日間へと短縮され、迅速かつスケーラブルなモデル生成が可能になった。
- ネットワーク距離指標はモデル類似性を的確に特定できており、同一ネットワークではdist = 0、完全に分離したネットワークではdist = ∞となる。この結果は、理論的整合性の妥当性を裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。