[논문 리뷰] NJst and ASTRID are not statistically consistent under a random model of missing data
이 논문은 ASTRID와 NJst가 i.i.d. 모형에 따른 무작위 종 삭제 조건 하에서도 종 계통수 추정에서 통계적으로 일致하지 않음을 입증한다. 유전자 계통수는 정확하게 추정된다고 하더라도 그렇다. 저자들은 반례를 제시하여 기대 내부 거리 행렬이 잘못된 4분할 계통수(topology) ac|bd에 대해 추가적(additive)으로 수렴함을 보이며, 이는 대량의 데이터가 존재함에도 불구하고 이러한 방법들이 잘못된 종 계통수를 추정하게 되는 이유를 설명한다.
Species tree estimation from multi-locus datasets is statistically challenging for multiple reasons, including gene tree heterogeneity across the genome due to incomplete lineage sorting (ILS). Species tree estimation methods have been developed that operate by estimating gene trees and then using those gene trees to estimate the species tree. Several of these methods (e.g., ASTRAL, ASTRID, and NJst) are provably statistically consistent under the multi-species coalescent (MSC) model, provided that the gene trees are estimated correctly, and there is no missing data. Recently, Nute et al. (BMC Genomics 2018) addressed the question of whether these methods remain statistically consistent under random models of taxon deletion, and asserted that they do so. Here we provide a counterexample to one of these theorems, and establish that ASTRID and NJst are not statistically consistent under an i.i.d. model of taxon deletion.
연구 동기 및 목표
- i.i.d. 모형 하에서 종이 유전자 계통수에서 무작위로 삭제될 경우 ASTRID와 NJst가 여전히 통계적으로 일치하는지 조사하기.
- Nute 등(2018)에서 제기한, 이러한 방법들이 무작위 누락 데이터 하에서도 통계적으로 일치한다는 주장에 도전하기.
- MSC + M_iid 모형 하에서 기대 내부 거리 행렬이 진정한 종 계통수 구조와 다른 구조에서 추가적(additive)일 수 있음을 입증하기.
- 이러한 모형 하에서 ASTRID와 NJst가 진정한 종 계통수로 수렴하지 못하고 잘못된 계통수를 유도할 수 있음을 보여주기.
제안 방법
- 6개 종을 가진 균형 잡힌 초등거리 종 계통수를 구성하고, 분기 길이를 무한대(L = ∞)로, 루트 간선 길이를 0(ε = 0)으로 설정한다.
- 각 종이 존재할 확률이 p이고, 존재하지 않을 확률이 q = 1−p인 i.i.d. 삭제 과정을 사용하여 누락 데이터를 모델링한다.
- 유래 계통의 생존 라인 수에 조건을 두고 기대 내부 거리를 계산하며, 기댓값 E₂=0, E₃=1, E₄=5/3를 활용한다.
- 모든 가능한 라인 수 존재/부재 조합과 그 확률을 고려하여 쌍 (a,b), (a,c), (b,d)의 기대 거리를 합산한다.
- 4점 불등식을 사용하여 기대 거리 행렬이 진정한 4분할 계통수 ab|cd가 아니라 ac|bd를 지지하는지 테스트한다.
- 엄격한 4점 불등식이 ac|bd를 향해 위반됨을 입증함으로써, 이 행렬이 다른 트리 구조에 대해 추가적임을 나타낸다.
실험 결과
연구 질문
- RQ1i.i.d. 모형 하에서 무작위 종 삭제 조건 하에서도 ASTRID와 NJst의 통계적 일致성이 유지되는가?
- RQ2MSC + M_iid 모형 하에서 기대 내부 거리 행렬이 진정한 종 계통수 구조에 대해 추가적인가?
- RQ3무작위 누락 데이터 하에서 ASTRID와 NJst가 진정한 종 계통수와 다른 계통수로 수렴할 수 있는가?
- RQ4Nute 등(2018)에서 주장한, ASTRID와 NJst가 무작위 누락 데이터 하에서도 통계적으로 일치한다는 주장은 옳은가?
주요 결과
- 반례에서 MSC + M_iid 모형 하에서 ASTRID와 NJst의 기대 내부 거리 행렬은 진정한 종 계통수 구조에 대해 추가적이지 않다.
- 기대 거리는 4분할 계통수 ac|bd에 대해 엄격한 4점 불등식을 만족함을 보이며, 이는 해당 구조를 가진 트리로 수렴함을 시사한다.
- 이는 ASTRID와 NJst가 데이터 크기가 증가함에 따라 잘못된 종 계통수를 유도할 가능성이 높다는 것을 의미한다.
- 따라서 이러한 방법들은 i.i.d. 누락 데이터 모형 하에서는 통계적으로 일치하지 않으며, 오히려 오도된 결과를 유도한다.
- 이 반례는 충분히 작은 ε > 0 이하와 유한한 큰 L < ∞ 에서도 성립함을 보이며, 모델의 미세한 변형에 대해 결과가 강건함을 보여준다.
- 이러한 실패의 원인은 라인 수 존재/부재가 공진화 패턴에 영향을 주어 기대 거리를 잘못된 계통수를 선호하도록 편향시키기 때문이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.