Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Inference for Tumor Subclones Accounting for Sequencing and Structural Variants

Ju‐Hee Lee, Peter Müeller|arXiv (Cornell University)|Sep 25, 2014
Cancer Genomics and Diagnostics参考文献 27被引用数 5
ひとこと要約

本論文は、次世代シーケンシング(NGS)データを用いて腫瘍のサブクローナルコピー数、バリアントアレルカウント、および細胞内割合を同時に推定するベイジアン特徴割り当てモデルを提案する。サブクローナル構造を非パrametricな事前分布を用いた3つの確率的行列(L、Z、w)でモデル化することで、サブクローナル構造の同定精度が向上し、2つの推定サブクローヌルを有するシミュレート済みおよび実際の肺がんデータにおいて優れた性能を示した。

ABSTRACT

Tumor samples are heterogeneous. They consist of different subclones that are characterized by differences in DNA nucleotide sequences and copy numbers on multiple loci. Heterogeneity can be measured through the identification of the subclonal copy number and sequence at a selected set of loci. Understanding that the accurate identification of variant allele fractions greatly depends on a precise determination of copy numbers, we develop a Bayesian feature allocation model for jointly calling subclonal copy numbers and the corresponding allele sequences for the same loci. The proposed method utilizes three random matrices, L, Z and w to represent subclonal copy numbers (L), numbers of subclonal variant alleles (Z) and cellular fractions of subclones in samples (w), respectively. The unknown number of subclones implies a random number of columns for these matrices. We use next-generation sequencing data to estimate the subclonal structures through inference on these three matrices. Using simulation studies and a real data analysis, we demonstrate how posterior inference on the subclonal structure is enhanced with the joint modeling of both structure and sequencing variants on subclonal genomes. Software is available at http://compgenome.org/BayClone2.

研究の動機と目的

  • 腫瘍サンプルにおいてサブクローナルコピー数とバリアントアレルカウントを同時に推定する計算モデルの不足に対処すること。
  • 統合フレームワーク内で構造的(コピー数)および配列的(SNV)バリアントを統合することで、バリアントアレルフラクション推定の精度を向上させること。
  • コピー数とアレルカウントの不確実性を考慮した、サブクローナル構造の確率的推論手法を提供すること。
  • 異質な腫瘍の真のサブクローナル構成を明らかにすることで、より正確ながん予後予測および標的療法を可能にすること。
  • SNPアレイや患者レベルのクラスタリングなどの追加データソースを容易に統合できる柔軟でスケーラブルなモデルを開発すること。

提案手法

  • 本手法は、サブクローナルコピー数(L)、バリアントアレルカウント(Z)、およびサブクローナル細胞内割合(w)の3つの潜在的確率的行列を用いる。
  • 未知のサブクローナル数をモデル化するため、有限版のカテゴリカル・インディアン・バーバー・プロセスに基づく非パrametric事前分布が用いられ、行列の列次元をランダムに変動可能にする。
  • マルコフ連鎖モンテカルロ(MCMC)サンプリングを用いて、シーケンシングリードカウントと観測されたバリアント頻度をもとに、3つの行列の事後分布推定を実行する。
  • リード深度とlocus間におけるアレル特異的シグナルを統合することで、コピー数状態とバリアントアレルカウントを同時に推定する。
  • ハイパーパramータはシミュレーションスタディを用いて調整され、事後推定値は合成および実際の肺がんNGSデータを用いて検証された。
  • フレームワークは不確実性の定量化を可能とし、SNPアレイデータなどの追加データタイプの統合も可能である。

実験結果

リサーチクエスチョン

  • RQ1コピー数バリアントと単一ヌクレオチドバリアントの統合的モデリングは、サブクローナル構造推定の精度をどのように向上させるか?
  • RQ2異質な腫瘍サンプルにおいて、コピー数情報を統合することでバリアントアレルフラクション推定に与える影響は何か?
  • RQ3事前に固定された数を仮定せずに、ベイジアン非パrametricモデルが効果的にサブクローナル数とその遺伝的プロファイルを推定できるか?
  • RQ4PyCloneなどの既存ツールと比較して、本手法はサブクローナル有病率とlocusクラスタリングの推定においてどのように優れているか?
  • RQ5本モデルは、パーソナライズドがん治療や臨床試験設計といった後続応用分野をどの程度向上させるか?

主な発見

  • 実際の肺がんデータセットでは、2つのサブクローナル(C*=2)が正常に同定され、空間的異質性が限定的であるという生物学的期待と整合的であった。
  • 事後予測チェックでは、推定リードカウント(N̂st)とバリアントフラクション(p̂st)が観測値の周囲に集中しており、データへの適合度が良好であることが示された。
  • 推定コピー数行列L*は多くのlocusで3コピーを示しており、データで観測された高いリード深度を反映していた。
  • 細胞内割合行列w*は、空間的に近接した4つの腫瘍サンプル間で高い類似性を示し、サブクローナル多様性が限定的であるという生物学的妥当性を支持した。
  • PyCloneは実際のサブクローナル集団を直接モデリングしないが、本手法はサブクローナル構造の統合的推定においてPyCloneを上回った。
  • シミュレーションスタディにおいて本モデルは、ノイズの程度やサブクローナル複雑性の変動に対しても、サブクローナル構造を正確に回復するという強靭性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。