Skip to main content
QUICK REVIEW

[논문 리뷰] Reconstructing protein and gene phylogenies by extending the framework of reconciliation

Esaie Kuitche, Lafond, Manuel|arXiv (Cornell University)|2016. 10. 30.
Genomics and Phylogenetic Studies참고 문헌 15인용 수 3
한 줄 요약

이 논문은 유전자 나무와 단백질 나무를 구분하는 새로운 재결합 프레임워크를 제안하며, 표준 유전자-종 나무 재결합 이외에 단백질 생성 및 손실 이벤트를 모델링하여 단백질 진화를 설명한다. 이는 종과 단백질 나무를 함께 고려한 이중 재결합 비용을 최소화하는 데 목적이 있는 두 가지 새로운 문제인 MinDRGT 및 MinDRPGT를 제안하며, Ensembl 유전자 나무 수정에서 뚜렷한 비용 절감 효과를 보여주는 히우리스틱 알고리즘을 통해 정확한 유전자 및 단백질 계통수 재구성 가능성을 입증한다.

ABSTRACT

The architecture of eukaryotic coding genes allows the production of several different protein isoforms by genes. Current gene phylogeny reconstruction methods make use of a single protein product per gene, ignoring information on alternative protein isoforms. These methods often lead to inaccurate gene tree reconstructions that require to be corrected before being used in phylogenetic tree reconciliation analyses or gene products phylogeny reconstructions. Here, we propose a new approach for the reconstruction of accurate gene trees and protein trees accounting for the production of alternative protein isoforms by the genes of a gene family. We extend the concept of reconciliation to protein trees, and we define a new reconciliation problem called MinDRGT that consists in finding a gene tree that minimizes a double reconciliation cost with a given protein tree and a given species tree. We define a second problem called MinDRPGT that consists in finding a protein tree and a gene tree minimizing a double reconciliation cost, given a species tree and a set of protein subtrees. We provide algorithmic exact and heuristic solutions for some versions of the problems, and we present the results of an application to the correction of gene trees from the Ensembl database. An implementation of the heuristic method is available at https://github.com/UdeS-CoBIUS/Protein2GeneTree.

연구 동기 및 목표

  • 유전자가 생성하는 대체 단백질 이소형을 무시하는 현재의 유전자 나무 재구성 방식에서 발생하는 정확도 문제를 해결하기 위해.
  • 단백질 나무가 유전자 나무 내에서 진화하는 이중 레이어 재결합 모델을 정식화하여, 고전적 유전자-종 나무 재결합을 확장하기 위해.
  • 단백질, 유전자, 종 나무 간의 재결합 비용을 동시에 최소화하는 최적화 문제인 MinDRGT 및 MinDRPGT를 개발하기 위해.
  • 이러한 문제를 해결하기 위한 정확 알고리즘과 히우리스틱 알고리즘을 제공하여, Ensembl과 같은 데이터베이스의 기존 유전자 나무 수정에 특화하기 위해.
  • 실제 생물학적 데이터를 대상으로 평가하여 수정된 유전자 나무가 뚜렷한 재결합 비용 절감 효과를 보임을 입증하기 위해.

제안 방법

  • 유전자-단백질 나무 재결합을 정의함으로써, 분열, 중복, 손실 외에 단백질 생성 및 단백질 손실라는 두 가지 새로운 진화 이벤트를 도입한다.
  • MinDRGT 문제를 제안한다: 주어진 단백질 나무와 종 나무에서, 단백질-유전자 및 유전자-종 재결합 비용의 합을 최소화하는 유전자 나무를 찾는 문제이다.
  • MinDRPGT 문제를 제안한다: 주어진 종 나무와 단백질 부분나무 집합에서, 동일한 이중 재결합 비용을 최소화하는 단백질 나무와 유전자 나무를 동시에 재구성하는 문제이다.
  • 입력 단백질 나무를 종 나무를 가이드로 사용하여 수정함으로써 최적의 유전자 나무를 생성하는 히우리스틱 알고리즘을 개발한다.
  • 부드러운 클러스터링 기법을 사용해 생성 없이 단백질 부분나무를 식별하고, 이를 통해 MinDRPGT 문제를 MinDRGT 문제로 다항 시간 내에 환원한다.
  • 히우리스틱 알고리즘을 사용해 10,861개의 Ensembl 유전자 나무를 수정하였으며, 결과적으로 뚜렷한 비용 절감과 정확도 향상이 확인되었다.

실험 결과

연구 질문

  • RQ1단백질 생성 및 손실 이벤트를 명시적으로 모델링함으로써, 단백질 이소형 생성을 고려한 유전자 나무 재구성이 더 정확한가?
  • RQ2각 유전자가 단일 단백질을 생성할 경우, 최적의 유전자 나무는 입력된 단백질 나무와 반드시 동일한가, 아니면 재결합 비용을 최소화하기 위해 다를 수 있는가?
  • RQ3최대 생성 없이 단백질 부분나무 집합만 주어졌을 때, 단백질 및 유전자 나무의 공동 재구성(MinDRPGT) 문제가 효율적으로 해결될 수 있는가?
  • RQ4MinDRGT 및 MinDRPGT 문제의 계산 복잡도는 얼마이며, 특정 조건 하에서 근사화하거나 정확하게 해결할 수 있는가?
  • RQ5제안된 방법이 Ensembl와 같은 실제 생물학적 데이터셋에서 재결합 비용 절감에 얼마나 효과적인가?

주요 결과

  • 10,861개의 Ensembl 유전자 나무 중 100~199개의 잎을 가진 큰 나무들 중 96.73%가 히우리스틱 알고리즘에 의해 수정되었으며, 이는 初기 재결합 결과의 광범위한 비최적성(서브옵티멀리티)을 시사한다.
  • 수정된 나무들은 평균 15.84ms의 실행 시간 단축과 평균 4.35%의 이중 재결합 비용 감소를 보였으며, 나무당 평균 307.29의 비용 감소를 기록했다.
  • 작은 나무(1~9개의 잎)의 경우 평균 18.67%의 이중 재결합 비용 감소, 중간 크기 나무(10~99개의 잎)는 6.01%, 큰 나무(100~199개의 잎)는 4.35%의 비용 감소를 기록했다.
  • 유전자가 단일 단백질만 생성하더라도 최적의 유전자 나무가 입력된 단백질 나무와 다를 수 있음을 확인하였으며, 이는 유전자 계통수와 단백질 계통수가 동일하지 않음을 보여준다.
  • 모든 최대 생성 없이 단백질 부분나무가 알려져 있을 경우, MinDRPGT 문제는 다항 시간 내에 MinDRGT 문제로 환원 가능하며, 이는 전체 단백질 나무의 정확한 재구성 가능성을 보장한다.
  • 알고리즘은 생성 없이 부분나무에서 전체 단백질 나무를 $ O(n^3) $ 시간 복잡도로 성공적으로 재구성하였으며, 이는 이론적 환원의 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.