Skip to main content
QUICK REVIEW

[논문 리뷰] kdetrees: Nonparametric Estimation of Phylogenetic Tree Distributions

Grady Weyenberg, Peter Huggins|arXiv (Cornell University)|2013. 02. 26.
Genomics and Phylogenetic Studies참고 문헌 63인용 수 7
한 줄 요약

kdetrees는 수평 전달, 병리학 또는 정렬 오류와 같은 과정으로 인해 발생하는 이질적 유전자 계통수를 식별하기 위해 계통수 분포에 대한 비모수적 커널 밀도 추정 방법을 제안한다. 이 방법은 이차 복잡도를 가지며, 정확도 손실이 최소화된 채로 이전 방법보다 효율성이 뛰어나며, Apicomplexa 및 Epichloë 데이터셋에서 생물학적으로 의미 있는 이질적 계통수를 성공적으로 탐지한다.

ABSTRACT

Motivation: While the majority of gene histories found in a clade of organisms are expected to be generated by a common process (e.g. the coalescent process), it is well-known that numerous other coexisting processes (e.g. horizontal gene transfers, gene duplication and subsequent neofunctionalization) will cause some genes to exhibit a history quite distinct from those of the majority of genes. Such "outlying" gene trees are considered to be biologically interesting and identifying these genes has become an important problem in phylogenetics. Results: We propose and implement KDETREES, a nonparametric method of estimating distributions of phylogenetic trees, with the goal of identifying trees which are significantly different from the rest of the trees in the sample. Our method compares favorably with a similar recently-published method, featuring an improvement of one polynomial order of computational complexity (to quadratic in the number of trees analyzed), with simulation studies suggesting only a small penalty to classification accuracy. Application of KDETREES to a set of Apicomplexa genes identified several unreliable sequence alignments which had escaped previous detection, as well as a gene independently reported as a possible case of horizontal gene transfer. We also analyze a set of Epichloe genes, fungi symbiotic with grasses, successfully identifying a contrived instance of paralogy. Availability: Our method for estimating tree distributions and identifying outlying trees is implemented as the R package KDETREES, and is available for download from CRAN.

연구 동기 및 목표

  • 특정한 파라미터 모형을 가정하지 않고 계통수 분포를 추정하기 위한 비모수적 방법을 개발하는 것.
  • 다수의 분포에서 크게 이탈하는 유전자 계통수를 식별하여 수평 전이 또는 병리학과 같은 생물학적 이면을 나타내는 것.
  • 기존 방법에 비해 계산 효율성을 향상시켜 이차 복잡도를 달성하고 고차 다항식 복잡도를 초월하는 것.
  • 오류 정렬, 잘못된 애너테이션 또는 잘못된 계통수 재구성과 같은 생물정보학적 오류를 탐지하기 위한 강력한 도구를 제공하는 것.
  • 수천 개의 유전자 계통수를 포함하는 대규모 유전체 분석에 적합한 효율적인 이질적 계통수 탐지 기능을 통해 확장 가능한 전장 유전체 계통수 분석을 지원하는 것.

제안 방법

  • 계통수 공간에서 커널 밀도 추정(KDE)을 사용하며, 커널 함수는 계통수의 분기 길이 유사도와 분기 구조 유사도에 기반한다.
  • 로빈슨-풀즈 거리와 분기 길이 차이를 기반으로 계통수별 커널을 구성함으로써, 기저 계통수 분포의 비모수적 추정이 가능해진다.
  • 유사도가 낮은 밀도를 가진 계통수를 순위 매김함으로써 이질적 계통수 탐지가 수행되며, 낮은 밀도는 주된 분포에서의 이격도가 크다는 것을 의미한다.
  • 알고리즘은 계통수의 수에 따라 이차적으로 확장되며, 대규모 계통수 분석에 적합하다.
  • CRAN에 배포된 R 패키지로 구현되어 있으며, 표준 계통수 분석 파이프라인에 쉽게 통합할 수 있다.
  • 단일 점 추정에 의존하지 않고 베이지안 추론에서 생성된 유전자 계통수의 사후 표본에 적용 가능하다.

실험 결과

연구 질문

  • RQ1특정한 파라미터 모형을 가정하지 않고도 비모수적 방법이 효과적으로 이질적 유전자 계통수를 식별할 수 있는가?
  • RQ2제안된 방법의 계산 복잡도는 기존 접근법과 비교해 어떻게 되며, 분류 정확도와의 상호 교환 관계는 어떠한가?
  • RQ3kdetrees는 실제 유전체 데이터셋에서 수평 전이나 병리학으로 인한 생물학적으로 의미 있는 이질적 계통수를 탐지할 수 있는가?
  • RQ4kdetrees는 정렬 오류나 잘못된 애너테이션과 같은 기술적 오류를 어느 정도 탐지할 수 있는가?
  • RQ5수천 개의 유전자 계통수를 포함하는 전장 유전체 분석에 대해 이 방법은 효율적으로 확장 가능한가?

주요 결과

  • kdetrees는 Apicomplexa 데이터셋에서 Set8 유전자를 가장 이질적인 계통수로 성공적으로 식별하였으며, 이후 수평 전이의 가능성이 확인되었다.
  • 기존 표준 방법으로는 이전에 발견되지 못한 Apicomplexa 데이터셋 내 몇몇 신뢰할 수 없는 서열 정렬을 탐지하였다.
  • Epichloë 데이터셋에서 kdetrees는 병리학적 CysD/LolC 정렬을 이질적 계통수로 정확히 식별하여, 병리학 관련 분리 현상을 탐지할 수 있음을 검증하였다.
  • 시뮬레이션 연구 결과, 비모수적 성격에도 불구하고 파라미터 모형 방법과 비교해 정확도 손실이 미미하며 높은 분류 정확도를 유지함을 확인하였다.
  • 이 방법은 이차 계산 복잡도를 달성하여 이전 방법의 고차 다항식 복잡도에 비해 크게 향상되었다.
  • kdetrees는 오류가 의심되는 서열과 정렬을 강조함으로써 데이터 정제 도구로서의 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.