Skip to main content
QUICK REVIEW

[논문 리뷰] Species richness estimation with high diversity but spurious singletons

Amy D. Willis|arXiv (Cornell University)|2016. 04. 09.
Species Distribution and Climate Change참고 문헌 7인용 수 5
한 줄 요약

이 논문은 R 패키지 breakaway에 구현된 통계적 방법을 소개하여, 비단순 빈도 수를 기반으로 미관측 및 진짜 단일종(_singleton_ exclusive_ taxon_)을 예측함으로써 고다양성 미생물 공동체의 종 다양성 수준을 추정한다. 기존의 다양성 추정 방법은 단일종 빈도 수가 신뢰할 수 없을 경우 매우 불안정한 경향이 있음을 보여주며, 측정 오차가 존재하는 상황에서 breakaway_nof1이 더 견고한 추정을 제공함을 보여준다. 다만 저자는 표준 오차가 매우 큰 경우를 고려하지 않은 채 이러한 추정치를 과도하게 해석하는 것에 대해 주의를 당부한다.

ABSTRACT

The presence of uncommon taxa in high-throughput sequenced ecological samples pose challenges to the microbial ecologist, bioinformatician and statistician. It is rarely certain whether these taxa are truly present in the sample or the result of sequencing errors. Unfortunately, alpha-diversity quantification relies on accurate frequency counts, which can rarely be guaranteed. We present a species richness estimation tool which predicts both the number of unobserved taxa and the number of true singletons based on the non-singleton frequency counts. This method can be treated as either inferential (for formally estimating richness) or exploratory (for assessing robustness of the richness estimate to the singleton count). If the estimate, called breakaway_nof1, is comparable to other richness estimators, this provides evidence that the richness estimate is robust to the level of quality control (eg. chimera-checking) employed in pre-processing. The function breakaway_nof1 is freely available from CRAN via the R package breakaway.

연구 동기 및 목표

  • 시퀀싱 오류로 인해 단일종 빈도 수가 신뢰할 수 없을 경우 종 다양성 추정이 불안정해지는 문제를 다루기 위해.
  • 비단일종 빈도 수만을 사용하여, 진짜 단일종 빈도 수와 미관측 종 수를 예측하는 방법을 개발하기 위해.
  • 단일종 빈도 수의 측정 오차에 민감한 기존의 다양성 추정 방법에 대한 통계적으로 엄밀한 대안을 제공하기 위해.
  • 단일종 불확실성이 다양성 추정에 미치는 결정적인 영향을 강조하고, 표준 오차를 투명하게 보고할 것을 촉구하기 위해.

제안 방법

  • 모델은 연속된 빈도 수의 비율을 다음 형식의 유리 함수로 모델링한다: $ \frac{f_{j+1}}{f_j} = \frac{\beta_0 + \beta_1 j + \dots + \beta_p j^p}{1 + \alpha_1 j + \dots + \alpha_q j^q} + \varepsilon_j $, 여기서 $ f_j $ 는 $ j $ 번 관측된 종의 수이다.
  • 비선형 최소제곱법을 사용하여 모델의 매개변수를 추정함으로써, 미관측 빈도 수 $ \hat{f}_0 $ 와 진짜 단일종 빈도 수 $ \hat{f}_1 $ 를 예측할 수 있다.
  • 총 다양성 수준은 $ \hat{C} = \hat{f}_0 + \sum_{j \geq 1} f_j $ 로 추정되며, 표준 오차와 피팅 진단 정보도 함께 제공된다.
  • 이 방법은 단일종 빈도 수를 관측된 값에 의존하는 것이 아니라 잠재 변수로 간주하여, 오류가 발생할 수 있는 관측된 단일종 빈도 수에 대한 의존도를 줄인다.
  • 이 방법은 R 패키지 `breakaway` 내의 함수 `breakaway_nof1` 으로 구현되었으며, CRAN에서 무료로 이용 가능하다.
  • 이 방법은 단일종 빈도 수의 과소 또는 과대 조정 수준을 다양하게 설정한 시뮬레이션을 통해 평가되었으며, 실제 토양 마이크로바이옴 데이터셋에 적용되었다.

실험 결과

연구 질문

  • RQ1단일종 빈도 수의 불확실성이 고속 시퀀싱 데이터에서 종 다양성 추정의 신뢰성에 어떤 영향을 미치는가?
  • RQ2비단일종 빈도 수만을 사용하여 진짜 단일종 수와 미관측 종 수를 통계 모델로 예측할 수 있는가?
  • RQ3실제 시퀀싱 오차 수준과 단일종 과대 조정 상황에서 제안된 방법의 성능은 기존의 다양성 추정 방법과 어떻게 비교되는가?
  • RQ4단일종 빈도 수의 불확실성이 높을 경우, 이 방법이 치머라 검출 및 클러스터링 임계값 등의 사전 처리 설정에 대해 얼마나 견고한가?
  • RQ5단일종 빈도 수가 불안정할 경우, 표본 변동성의 영향을 고려하여 표준 오차에 어떤 영향을 미치는가?

주요 결과

  • method `breakaway_nof1` 는 단일종 빈도 수의 측정 오차를 고려하여 종 다양성 수준을 통계적으로 엄밀하게 추정할 수 있는 방법을 제공한다. 이는 일반적으로 미생물 시퀀싱 데이터에서 신뢰할 수 없는 경향이 있는 단일종 빈도 수를 반영한다.
  • 높은 단일종 과대 조정 상황(예: 100%)에서 `breakaway_nof1` 은 진짜 다양성 수준에 아래쪽에서 수렴하는 반면, 다른 추정 방법들은 위쪽에서 수렴함을 보여, 오차가 존재하는 상황에서 더 뛰어난 안정성을 보인다.
  • 시뮬레이션 결과, `breakaway_nof1` 은 `breakaway` 와 유사한 실행 시간(0.08–0.21초)을 보이며, `CatchAll` 보다 빠르지만, 단순성 덕분에 `Chao1` 이 가장 빠르다.
  • 5000개의 진짜 종이 존재하는 시뮬레이션에서, `breakaway_nof1` 은 단일종 과소 조정 및 과대 조정 상황에서 경쟁 방법들보다 안정적인 수렴과 낮은 오차를 보였다.
  • 이 방법은 다양한 수준의 단일종 불확실성에 대해 견고하며, 다양성 추정에 내재된 높은 표본 변동성을 반영한 표준 오차를 제공한다.
  • 저자는 이 방법을 사용하더라도 여전히 큰 표준 오차를 보고해야 한다고 경고하며, 이를 생략하는 것은 부주의한 과학 행위이며, 이러한 불확실성 정량화 없이 다양성에 대한 단정적인 결론을 내리는 것을 권장하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.