Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-State Perfect Phylogeny Mixture Deconvolution and Applications to Cancer Sequencing

Mohammed El-Kebir, Gryte Satas|arXiv (Cornell University)|2016. 04. 09.
Cancer Genomics and Diagnostics참고 문헌 27인용 수 4
한 줄 요약

이 논문은 복합적인 체세포 변이, 예를 들어 복수 수준의 복제수 이상변이(CNAs)와 단일염기다형성(SNVs)를 함께 모델링하여, 전체 종양 시퀀싱 데이터에서 다중상태 완벽한 계통수 나무를 재구성하기 위한 새로운 계산 프레임워크를 제안한다. 다중상태 완벽한 계통수 혼합 분해 문제를 수립하고, 이 문제가 NP-완전임을 증명하며, 계통수적 제약 조건 하에 유효한 나무를 열거하는 알고리즘을 개발한다. 시뮬레이션 및 실제 암 데이터셋에서 높은 정확도를 보이며, 표본 수가 증가할수록 해의 모호성이 감소함을 입증한다.

ABSTRACT

The reconstruction of phylogenetic trees from mixed populations has become important in the study of cancer evolution, as sequencing is often performed on bulk tumor tissue containing mixed populations of cells. Recent work has shown how to reconstruct a perfect phylogeny tree from samples that contain mixtures of two-state characters, where each character/locus is either mutated or not. However, most cancers contain more complex mutations, such as copy-number aberrations, that exhibit more than two states. We formulate the Multi-State Perfect Phylogeny Mixture Deconvolution Problem of reconstructing a multi-state perfect phylogeny tree given mixtures of the leaves of the tree. We characterize the solutions of this problem as a restricted class of spanning trees in a graph constructed from the input data, and prove that the problem is NP-complete. We derive an algorithm to enumerate such trees in the important special case of cladisitic characters, where the ordering of the states of each character is given. We apply our algorithm to simulated data and to two cancer datasets. On simulated data, we find that for a small number of samples, the Multi-State Perfect Phylogeny Mixture Deconvolution Problem often has many solutions, but that this ambiguity declines quickly as the number of samples increases. On real data, we recover copy-neutral loss of heterozygosity, single-copy amplification and single-copy deletion events, as well as their interactions with single-nucleotide variants.

연구 동기 및 목표

  • 복수 상태 돌연변이, 예를 들어 복제수 이상변이(CNAs)에 의해 유도되는 복잡한 암 진화를 포괄하지 못하는 기존의 이중상태 완벽한 계통수 모델의 한계를 해결하기 위해.
  • 오직 전체 시퀀싱 데이터(변이 대안 빈도, VAF)만 관측 가능한 혼합된 종양 세포 집단에서 다중상태 완벽한 계통수 나무를 재구성하는 계산 프레임워크를 개발하기 위해.
  • 유도된 그래프에서의 제약된 스패닝 트리로서 문제의 해 공간을 특성화하여, 가능한 진화 나무의 체계적 열거를 가능하게 하기 위해.
  • 시뮬레이션 데이터와 실제 암 데이터셋에서 방법을 평가하여, LOH, SCD, SCA 및 SNVs와의 상호작용을 포함한 생물학적으로 관련된 사건들을 회복할 수 있음을 입증하기 위해.

제안 방법

  • 변이 대안 빈도(VAF) 데이터에서 유도된 그래프에서 제약된 스패닝 트리 열거 작업으로서 다중상태 완벽한 계통수 혼합 분해 문제를 수립한다.
  • 각 돌연변이 이벤트(SNV, LOH, SCD, SCA)를 별개의 상태 트리로 모델링하며, 각 상태 트리가 혼합 비율과 관측된 VAF 간의 선형 시스템을 정의한다.
  • 각 상태 트리에 대해 VAF에 대한 간격 제약 조건을 유도하여, 관측된 돌연변이 빈도 기반으로 생물학적으로 비현실적인 해를 걸러내는 데 사용한다.
  • 계통수적 가정(즉, 순서된 상태 전이) 하에 모든 유효한 스패닝 트리를 열거하기 위해, 체인드 그래프 이론에서 유래한 제한된 삼각분할 기법을 활용한 조합 알고리즘을 적용한다.
  • 정점이 세포 집단에 대응하고 간선이 진화 전이를 나타내는 그래프 기반 표현을 사용하며, 해는 관측된 VAF에 의해 제약된다.
  • 상태 트리에서 유도된 선형 시스템을 사용하여 혼합물 내 각 세포 유형의 비율을 추정하기 위해 확률 모델을 활용한다.

실험 결과

연구 질문

  • RQ1복제수 이상변이와 같은 복수 상태 돌연변이가 관찰될 경우, 전체 종양 시퀀싱 데이터에서 다중상태 완벽한 계통수 나무를 재구성할 수 있는가?
  • RQ2혼합 분해 문제의 해의 수가 표본 수에 따라 어떻게 변화하는가? 더 많은 데이터가 제공될 경우 모호성이 감소하는가?
  • RQ3제안된 방법이 실제 암 데이터셋에서 복수 수의 이형성 손실(LOH), 단일복사 삭제(SCD), 단일복사 증폭(SCA) 등의 알려진 생물학적 사건을 정확히 회복할 수 있는가?
  • RQ4해 공간의 구조와 재구성된 진화 나무의 생물학적 타당성 사이의 관계는 어떠한가?
  • RQ5SNVs와 CNAs 간의 상호작용은 혼합 데이터에서 진정한 계통수의 식별 가능성에 어떤 영향을 미치는가?

주요 결과

  • 작은 수의 표본을 가진 시뮬레이션 데이터에서는 문제의 해가 매우 모호하며 많은 잠재적 해가 존재하지만, 표본 수가 증가함에 따라 이 모호성이 급격히 감소한다.
  • 오차가 없는 VAF를 가진 시뮬레이션 데이터에서는 대부분의 경우 진짜 계통수를 성공적으로 회복하며, 표본 수가 증가할수록 더욱 뚜렷하다.
  • 실제 암 데이터셋에서는 복수 수의 이형성 손실(LOH), 단일복사 삭제(SCD), 단일복사 증폭(SCA) 및 SNVs와의 상호작용을 포함한 알려진 생물학적 사건들을 성공적으로 회복한다.
  • 실제 종양 표본(A22 등)의 해 공간은 매우 클 수 있다(예: 24,288개의 서로 다른 나무), 하지만 방법은 해들 사이에서 일관된 진화 관계의 핵심을 식별한다.
  • 복잡한 CNA 이벤트가 존재하는 상황에서도 생물학적으로 타당한 진화 시나리오를 식별할 수 있으며, VAF 제약 조건이 비현실적인 나무를 효과적으로 걸러낸다.
  • 소음이 있는 데이터에 대해서도 알고리즘이 강건하며, 중간 수준의 소음에서도 실행 시간과 해의 수가 관리 가능하게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.