Skip to main content
QUICK REVIEW

[論文レビュー] Identifying cancer subtypes in glioblastoma by combining genomic, transcriptomic and epigenomic data

Richard S. Savage, Zoubin Ghahramani|arXiv (Cornell University)|Apr 12, 2013
Gene expression and cancer classification参考文献 10被引用数 7
ひとこと要約

本研究では、ゲノム、トランスクリプトーム、エピジェネティックスデータを統合して膠芽腫(glioblastoma)亜型を同定する、強化された非パrametricベイジアン手法を提案する。277例のTCGA膠芽腫サンプルから得られた遺伝子発現、コピー数変異、メチル化、およびmiRNAデータを統合的に分析することで、8つのコンSENSUS亜型を同定した。特に、メチル化データが再発を強く予測しており(log-rank p = 2.0×10⁻³)、10年間で再発がほぼゼロの低メチル化亜型が明確に特定された。

ABSTRACT

We present a nonparametric Bayesian method for disease subtype discovery in multi-dimensional cancer data. Our method can simultaneously analyse a wide range of data types, allowing for both agreement and disagreement between their underlying clustering structure. It includes feature selection and infers the most likely number of disease subtypes, given the data. We apply the method to 277 glioblastoma samples from The Cancer Genome Atlas, for which there are gene expression, copy number variation, methylation and microRNA data. We identify 8 distinct consensus subtypes and study their prognostic value for death, new tumour events, progression and recurrence. The consensus subtypes are prognostic of tumour recurrence (log-rank p-value of $3.6 imes 10^{-4}$ after correction for multiple hypothesis tests). This is driven principally by the methylation data (log-rank p-value of $2.0 imes 10^{-3}$) but the effect is strengthened by the other 3 data types, demonstrating the value of integrating multiple data types. Of particular note is a subtype of 47 patients characterised by very low levels of methylation. This subtype has very low rates of tumour recurrence and no new events in 10 years of follow up. We also identify a small gene expression subtype of 6 patients that shows particularly poor survival outcomes. Additionally, we note a consensus subtype that showly a highly distinctive data signature and suggest that it is therefore a biologically distinct subtype of glioblastoma. The code is available from https://sites.google.com/site/multipledatafusion/

研究の動機と目的

  • 多様な分子データからがん亜型を同定する堅牢な手法を開発すること、特にデータタイプ間で不一致がある場合にも対応できるようにすること。
  • 事前に亜型数を仮定せずに、最適な疾患亜型数を推定すること。
  • 遺伝子発現、コピー数、メチル化、miRNAといった複数のデータタイプにおける同時特徴選択を実行すること。
  • 複数のデータタイプにわたるコンセンサスクラスタリングから得られる亜型の予後的価値を評価すること。
  • データタイプ間のクラスタリング構造の不一致を分析することで、膠芽腫の生物学的複雑性を解明すること。

提案手法

  • 事前に亜型数を指定せずに柔軟なクラスタリングを可能にするために、ディリクレ過程混合モデルに基づく非パrametricベイジアンフレームワークを用いる。
  • MDIアルゴリズムを拡張し、データタイプに特化したモデルを導入:連続的データ(例:遺伝子発現、コピー数)には正規分布、二値的データ(例:メチル化、miRNA)には多項分布を適用。
  • 各データタイプごとに特徴選択を実施し、特徴の含む確率の事後分布を推定することで、最も情報量の多い遺伝子/プローブのみを選択。
  • 高次元クラスタリングにおける混合性と収束性を向上させるために、ギブスサンプリングとスプリット・マージ移動を組み合わせたハイブリッドMCMCサンプラーを採用。
  • クラスタリングのコンセンサスを、クラスターラベルの順序を整えることで、データタイプ間のクラスタ割り当てを事後類似度行列を用いて集約することで得る。
  • データタイプ間の一致度を、共有クラスタリング構造を推定するphi_klパラメータの事後平均値によって定量化。

実験結果

リサーチクエスチョン

  • RQ1統合ゲノム、トランスクリプトーム、エピジェネティクスデータにより、生物学的に意味のある膠芽腫亜型を統一的統計モデルで同定できるか?
  • RQ2異なる分子的データタイプは、膠芽腫サンプルのクラスタリングにおいてどの程度一致または不一致を示すか?
  • RQ3どの分子的データタイプが同定された亜型の予後的パワーに最も寄与しているか?
  • RQ4極端なメチル化レベルや予後不良の結果を示す特徴的な生物学的サブタイプが存在するか?
  • RQ5コンセンサスクラスタリング手法は、単一のデータタイプのみを用いた場合よりも、より生物学的に関連性の高い亜型を明らかにできるか?

主な発見

  • コンセンサスクラスタリングにより、8つの明確に区別できる膠芽腫亜型が同定され、特にメチル化データが腫瘍再発の予測において最も強い要因であった(log-rank p = 2.0×10⁻³)。
  • 47例の非常に低メチル化レベルを示す亜型では、10年間の追跡期間中に腫瘍再発または新たなイベントが1例も認められなかった。
  • 6例の遺伝子発現サブタイプは極めて不良な生存予後を示し、希少で攻撃性の高い膠芽腫の形態である可能性を示唆した。
  • 8例のコンセンサスサブタイプは、顕著な多オミクス特徴を示し、再発率が低く、生物学的に独立した膠芽腫亜型である可能性が示された。
  • 4つのデータタイプ間のクラスタリング構造は部分的な重なりしか示さず、単一の統一的亜型構造では説明できないほど、根本的な生物学的複雑性が存在することが示された。
  • 本手法は、事前に仮定を設けずに亜型数を推定し、関連する特徴を選択することができ、多オミクス統合において堅牢性と生物学的妥当性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。