[論文レビュー] Multi-State Perfect Phylogeny Mixture Deconvolution and Applications to Cancer Sequencing
本稿は、バッチ腫瘍シーケンシングデータからマルチステート完全系統樹を再構築するための新しい計算フレームワークを提案する。単一ヌクレオチド変異(SNVs)に加え、コピー数異常(CNAs)などの複雑な体細胞変異をモデル化する。マルチステート完全系統樹ミックスデコンボリューション問題を定式化し、NP完全性を証明した。系統樹のクラディスティック制約下で有効な木を列挙するためのアルゴリズムを開発し、サンプル数が増加するにつれて解の曖昧さが低下する傾向を示し、シミュレーテッドおよび実際のがんデータセットにおいて高い正確性を示した。
The reconstruction of phylogenetic trees from mixed populations has become important in the study of cancer evolution, as sequencing is often performed on bulk tumor tissue containing mixed populations of cells. Recent work has shown how to reconstruct a perfect phylogeny tree from samples that contain mixtures of two-state characters, where each character/locus is either mutated or not. However, most cancers contain more complex mutations, such as copy-number aberrations, that exhibit more than two states. We formulate the Multi-State Perfect Phylogeny Mixture Deconvolution Problem of reconstructing a multi-state perfect phylogeny tree given mixtures of the leaves of the tree. We characterize the solutions of this problem as a restricted class of spanning trees in a graph constructed from the input data, and prove that the problem is NP-complete. We derive an algorithm to enumerate such trees in the important special case of cladisitic characters, where the ordering of the states of each character is given. We apply our algorithm to simulated data and to two cancer datasets. On simulated data, we find that for a small number of samples, the Multi-State Perfect Phylogeny Mixture Deconvolution Problem often has many solutions, but that this ambiguity declines quickly as the number of samples increases. On real data, we recover copy-neutral loss of heterozygosity, single-copy amplification and single-copy deletion events, as well as their interactions with single-nucleotide variants.
研究の動機と目的
- コピー数異常(CNAs)のようなマルチステート突然変異が引き起こす複雑ながんの進化を捉えることができない既存の二状態完全系統樹モデルの限界を解消すること。
- バッチシーケンシングデータ(変異アレル頻度)しか観測されないがん細胞集団の混合物から、マルチステート完全系統樹を再構築する計算フレームワークを開発すること。
- 導出されたグラフにおける制約付きスパニングツリーとして、問題の解空間を特徴づけ、可能な進化的な系統樹を体系的に列挙可能にする。
- シミュレーテッドデータおよび実際のがんデータセット上で手法を評価し、LOH、SCD、SCA、およびそれらとSNVsの相互作用を含む生物学的に関連する出来事象を回復できるかを検証すること。
提案手法
- 変異アレル頻度(VAF)データから導出されたグラフにおける制約付きスパニングツリー列挙タスクとして、マルチステート完全系統樹ミックスデコンボリューション問題を定式化する。
- 各突然変異イベント(SNV、LOH、SCD、SCA)を別個のステートツリーとしてモデル化し、各ステートツリーが混合割合と観測されたVAFを関係付ける線形方程式系を定義する。
- 各ステートツリーに対するVAFの区間制約を導出し、観測された突然変異頻度に基づいて生物学的に不適切な解をフィルタリング可能にする。
- クラディスティック仮定(すなわち、順序付きステート遷移)の下で、すべての有効なスパニングツリーを列挙するための組合せ的アルゴリズムを適用。弦的グラフ理論からの制限付きトライアングル化技術を活用する。
- 頂点が細胞集団に対応し、辺が進化的な遷移を表すグラフベースの表現を採用。解は観測されたVAFによって制約される。
- ステートツリーから導出された線形方程式系を用いて、混合物内の各細胞タイプの割合を推定するための確率的モデルを採用する。
実験結果
リサーチクエスチョン
- RQ1コピー数異常のような、2つ以上の状態を示す突然変異が存在する場合、バッチ腫瘍シーケンシングデータからマルチステート完全系統樹を再構築できるか?
- RQ2ミックスデコンボリューション問題の解の数は、サンプル数にどのように依存するか。また、データ量が増えると曖昧さは減少するか?
- RQ3提案手法は、実際のがんデータセットにおいて、コピー中性ロスオブヘテロジェノシティ(LOH)、単一コピー欠失(SCD)、単一コピーアンプリフィケーション(SCA)といった既知の生物学的出来事象を正確に回復できるか?
- RQ4解空間の構造と再構築された進化的系統樹の生物学的妥当性の間にはどのような関係があるか?
- RQ5SNVsとCNAsの相互作用は、ミックスドデータからの真の系統樹の同定可能性にどのように影響するか?
主な発見
- サンプル数が少ないシミュレーテッドデータでは、多くの可能性のある解が存在するため曖昧さが高かったが、サンプル数が増えるにつれてその曇りが急速に減少した。
- ノイズのないVAFを有するシミュレーテッドデータでは、多数のケースで真の系統樹が正しく回復された。特にサンプル数が増えるとその正確性が向上した。
- 実際のがんデータセットでは、コピー中性LOH、SCD、SCA、およびそれらとSNVsの相互作用といった既知の生物学的出来事象が正しく回復された。
- 実際の腫瘍サンプル(例:A22)では解空間が大きくなる(例:24,288種類の異なる木)が、本手法は解の間で一貫した進化的関係のコアを特定した。
- 複雑なCNAイベントが存在する状況でも、生物学的に妥当な進化的シナリオを同定できた。VAF制約が不適切な系統樹を効果的にフィルタリングした。
- ノイズのあるデータに対しても本手法は頑健であり、中程度のノイズレベルでも実行時間と解の数が管理可能で残った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。