Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic analysis of the human transcriptome with side information

Leo Lahti|arXiv (Cornell University)|Feb 27, 2011
Gene expression and cancer classification参考文献 342被引用数 5
ひとこと要約

本学位論文は、ゲノムデータベースからのサイド情報と高スループット遺伝子発現データを統合することで、ヒトトランスクリプトームを分析するための確率的モデリング手法を開発した。測定精度の向上、機能的相互作用制約を用いた全生物的スケールでの臓器特異的転写調節ネットワークの探索的解析、およびマルチオミクスデータソース間の依存関係のモデル化により、システム生物学およびがん研究に向けた堅牢でスケーラブルなツールを提供し、オープンソースのBioConductor実装を伴う。

ABSTRACT

Understanding functional organization of genetic information is a major challenge in modern biology. Following the initial publication of the human genome sequence in 2001, advances in high-throughput measurement technologies and efficient sharing of research material through community databases have opened up new views to the study of living organisms and the structure of life. In this thesis, novel computational strategies have been developed to investigate a key functional layer of genetic information, the human transcriptome, which regulates the function of living cells through protein synthesis. The key contributions of the thesis are general exploratory tools for high-throughput data analysis that have provided new insights to cell-biological networks, cancer mechanisms and other aspects of genome function. A central challenge in functional genomics is that high-dimensional genomic observations are associated with high levels of complex and largely unknown sources of variation. By combining statistical evidence across multiple measurement sources and the wealth of background information in genomic data repositories it has been possible to solve some the uncertainties associated with individual observations and to identify functional mechanisms that could not be detected based on individual measurement sources. Statistical learning and probabilistic models provide a natural framework for such modeling tasks. Open source implementations of the key methodological contributions have been released to facilitate further adoption of the developed methods by the research community.

研究の動機と目的

  • ゲノムデータベースからのサイド情報を活用して、高次元かつノイズの多いトランスクリプトームデータの測定信頼性を向上させる課題に対処する。
  • ヒト全臓器にわたる転写活性のグローバルパターンおよび臓器の機能的関連性を推定するスケーラブルで探索的な手法を開発する。
  • 共起するトランスクリプトームおよびゲノムデータソースを統合し、隠れた機能的依存関係や生物学的メカニズムを解明する。
  • 統合的機能ゲノミクスおよびシステム生物学研究を支援するためのオープンソースで再利用可能な計算ツールを提供する。
  • 統計的学習と事前の生物学的知識を整合的な確率的枠組みで統合することで、複雑な生物学的システムの解析を前進させる。

提案手法

  • 高スループットマイクロアレイ測定からの統計的証拠と、配列および相互作用データベースからのサイド情報を統合するための確率的モデルを適用する。
  • ゲノム相互作用データベースからの既知または予測された遺伝子-遺伝子相互作用を用いて、生物学的に妥当なデータ領域にモデル化を制限・集中する。
  • 次元削減および部分空間モデリング技術を実装し、全ゲノムトランスクリプトームデータへのスケーラビリティを確保する。
  • 複数の測定ソース(例:遺伝子発現、miRNA、エピジェネティックマーク)を同時に分析する依存関係モデルを開発し、クロスレイヤー間の関係を捉える。
  • ベイズおよび潜在変数フレームワークを活用して、大規模ゲノム観測における不確実性と異質性を扱う。
  • コア手法の再現可能性およびコミュニティによる採用を確保するため、BioConductorにオープンソース実装をリリースする。

実験結果

リサーチクエスチョン

  • RQ1ゲノムデータベースからのサイド情報は、どのように高スループットマイクロアレイ測定の精度を向上させることができるか?
  • RQ2機能的相互作用制約を分析に統合した場合、正常ヒト臓器にわたるトランスクリプトームネットワーク活性化のグローバルパターンはどのように明らかになるか?
  • RQ3共起するトランスクリプトームおよび他のゲノムデータレイヤー間の依存関係は、どのようにモデル化され、隠れた機能的メカニズムが解明されるか?
  • RQ4サイド情報を用いた確率的モデリングは、ノイズが多く高次元なトランスクリプトームデータにおいて、生物学的に有意義な信号の検出をどの程度向上させられるか?
  • RQ5これらの手法は、ヒトトランスクリプトームにおけるがんや進化的変異といった複雑疾患の解析に、どのように一般化・応用可能か?

主な発見

  • ゲノムデータベースからのサイド情報の統合により、ノイズとバイアスの低減が実現され、高スループットマイクロアレイ測定の精度が顕著に向上した。
  • 提案された探索的手法は、相互作用制約を用いることで、ヒト臓器にわたる臓器特異的トランスクリプトームネットワークパターンおよび機能的関連性を効果的に同定した。
  • マルチオミクスデータソースの確率的モデリングにより、単独では検出できない機能的メカニズムやレギュラトリープロセスが明らかになった。
  • 本手法は全ゲノムトランスクリプトームデータに効果的にスケーリング可能であり、事前の生物学的仮定なしに全生物的スケールでの解析を可能にした。
  • BioConductorにリリースされたオープンソース実装により、機能ゲノミクスおよびシステム生物学分野での手法の採用と拡張が促進された。
  • 多様なゲノム情報の統合により、がん研究および進化的ゲノミクスへの応用の強力な可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。