Skip to main content
QUICK REVIEW

[논문 리뷰] A mixture model for determining SARS-Cov-2 variant composition in pooled samples

Silva, Israel Tojal da|arXiv (Cornell University)|2022. 01. 01.
SARS-CoV-2 detection and testing참고 문헌 33인용 수 54
한 줄 요약

이 논문은 유전적 다형성(SNPs/indels)을 마커로 사용하여 풀린 샘플 내 SARS-CoV-2 변종의 상대 빈도를 추정하기 위한 통계적 혼합 모델을 제안한다. 이 방법은 변종별로 특화된 위치에서의 시퀀싱 리드 수를 기반으로 최대우도추정을 수행하며, 잠재적 변종 기여도와 커버리지 변동성을 고려한다. 시뮬레이션에서는 변종 비율을 정확히 복원하고, 스위스의 실제 하수도 샘플 데이터에서는 임상 역학적 추세와 강한 상관관계를 보이며, 인구 수준의 바이러스 감시에 유용함을 입증한다.

ABSTRACT

Despite of the fast development of highly effective vaccines to control the current COVID$-$19 pandemic, the unequal distribution and availability of these vaccines worldwide and the number of people infected in the world lead to the continuous emergence of SARS-CoV-2 (Severe Acute Respiratory Syndrome coronavirus 2) variants of concern. It is likely that real-time genomic surveillance will be continuously needed as an unceasing monitoring tool, necessary to follow the spillover of the disease spread and the evolution of the virus. In this context, new genomic variants of SARS-CoV-2 that may emerge as a response to selective pressure, including variants refractory to current vaccines, makes genomic surveillance programs tools of utmost importance. Here propose a statistical model for the estimation of the relative frequencies of SARS-CoV-2 variants in pooled samples. This model is built by considering a previously defined selection of genomic polymorphisms that characterize SARS-CoV-2 variants. The methods described here support both raw sequencing reads for polymorphisms-based markers calling and predefined markers in the VCF format. Results obtained by using simulated data show that our method is quite effective in recovering the correct variant proportions. Further, results obtained by considering longitudinal data from wastewater samples of two locations in Switzerland agree well with those describing the epidemiological evolution of COVID-19 variants in clinical samples of these locations. Our results show that the described method can be a valuable tool for tracking the proportions of SARS-CoV-2 variants.

연구 동기 및 목표

  • 풀린 SARS-CoV-2 샘플 내에서 다수의 바이러스 계통이 공존하는 상황에서 상대 변종 빈도를 추정하기 위한 통계적 방법을 개발하는 것.
  • 낮고 변동성이 큰 커버리지 조건에서 단순 시퀀싱 리드 데이터로부터 변종 구성 요소를 추론하는 데 도전하는 것.
  • 하수도와 같은 풀린 샘플을 활용하여 비용 효율적이고 고속의 감시를 가능하게 하는 것.
  • 시뮬레이션 데이터와 스위스에서의 실제 하수도 시퀀싱 데이터를 통해 방법을 검증하는 것.
  • 임상 역학적 데이터와 일치하는 변종 빈도 추세를 제공하여 공중보건 모니터링을 지원하는 것.

제안 방법

  • 이 방법은 SARS-CoV-2 변종을 정의하는 사전 선택된 유전자 다형성(SNPs/indels)을 기반으로 한 혼합 모델을 사용하여 변종 구성 요소를 모델링한다.
  • 각 다형성 위치에서 관측된 참조 및 대체 염기형 수에 대한 잠재 변수(각 변종의 기여도)를 통합하는 우도 함수를 적용한다.
  • 우도는 변종 간 리드 분포가 다항분포를 이룬다고 가정하며, 추정해야 할 매개변수로 변종 비율 wj를 사용한다.
  • 최대우도추정을 통해 ∑wj = 1 및 0 ≤ wj ≤ 1 조건 하에 상대 변종 빈도 벡터 w = (w1, ..., wv)를 추정한다.
  • 각 다형성 위치에서의 총 리드 수 ti = ca_i + cr_i 를 포함하여 위치 간 커버리지 변동성을 모델링한다.
  • 표준 오차 추정 및 변종 빈도 예측의 불확실성 측정을 위해 부트스트랩 재표본 추출 기법을 적용한다.

실험 결과

연구 질문

  • RQ1통계적 혼합 모델은 풀린 임상 또는 환경 샘플 내 SARS-CoV-2 변종의 상대 빈도를 정확하게 추정할 수 있는가?
  • RQ2낮은 시퀀싱 깊이 및 변동성이 큰 커버리지 조건에서 모델의 성능은 어떠한가?
  • RQ3하수도 샘플에서 추정한 변종 빈도는 임상 역학적 추세와 어느 정도 상관관계를 보이는가?
  • RQ4실제 환경에서 새로운 변종을 탐지하고 계통의 동적 변화를 추적할 수 있는가?
  • RQ5모델은 변종 내 유전적 이질성과 계통 간 공통 다형성에 대해 얼마나 강인한가?

주요 결과

  • 낮은 시퀀싱 깊이에서도 시뮬레이션 데이터에서 진짜 변종 비율을 정확히 복원하며, 높은 정확도와 민감도를 보였다.
  • 루산 및 취리히에서의 하수도 샘플 분석에서 추정된 변종 빈도는 동일 지역의 임상 시퀀싱 데이터에서 관찰된 역학적 추세와 매우 밀접하게 일치했다.
  • 122개의 하수도 샘플에 대한 종단적 분석에서 알파 변종의 상승과 감소 추세가 지역 임상 데이터와 일치하여 일관된 감지가 이루어졌다.
  • 변동 커버리지와 확률적 샘플링에 대해 모델 성능이 강인했으며, 부트스트랩 기반 불확실성 추정치는 신뢰성 있는 예측 구간을 제공했다.
  • 모델은 시간에 따라 변종 전환과 우세성 변화를 성공적으로 식별하여 감시에 실용성을 확인했다.
  • 소프트웨어 파이프라인은 확장 가능하며, VCF 형식의 사용자 정의 마커 세트를 지원하고 워크플로우 엔진을 통해 병렬 처리가 가능해 효율적인 처리를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.