[論文レビュー] A mixture model for determining SARS-Cov-2 variant composition in pooled samples
本論文は、ゲノム多様性(SNPs/indels)をマーカーとして用い、プールされたサンプル内のSARS-CoV-2変異株の相対頻度を推定する統計的混合モデルを提案する。この手法は、変異株固有の座標におけるシークエンシングリードカウントを用いて最尤推定を実行し、潜在的な変異株寄与とカバレッジのばらつきを考慮する。シミュレーションでは正確に変異株頻度を回復し、スイスの実際の下水データにおいて臨床疫学的傾向と強い相関を示す。これは、集団レベルのウイルス監視に有効であることを示している。
Despite of the fast development of highly effective vaccines to control the current COVID$-$19 pandemic, the unequal distribution and availability of these vaccines worldwide and the number of people infected in the world lead to the continuous emergence of SARS-CoV-2 (Severe Acute Respiratory Syndrome coronavirus 2) variants of concern. It is likely that real-time genomic surveillance will be continuously needed as an unceasing monitoring tool, necessary to follow the spillover of the disease spread and the evolution of the virus. In this context, new genomic variants of SARS-CoV-2 that may emerge as a response to selective pressure, including variants refractory to current vaccines, makes genomic surveillance programs tools of utmost importance. Here propose a statistical model for the estimation of the relative frequencies of SARS-CoV-2 variants in pooled samples. This model is built by considering a previously defined selection of genomic polymorphisms that characterize SARS-CoV-2 variants. The methods described here support both raw sequencing reads for polymorphisms-based markers calling and predefined markers in the VCF format. Results obtained by using simulated data show that our method is quite effective in recovering the correct variant proportions. Further, results obtained by considering longitudinal data from wastewater samples of two locations in Switzerland agree well with those describing the epidemiological evolution of COVID-19 variants in clinical samples of these locations. Our results show that the described method can be a valuable tool for tracking the proportions of SARS-CoV-2 variants.
研究の動機と目的
- 複数のウイルス系統が共存するプールされたSARS-CoV-2サンプルにおける相対的変異株頻度を推定する統計的手法を開発すること。
- 低くかつ可変なカバレッジを示す短鎖シークエンシングデータから変異株構成を推定する課題に対処すること。
- 下水などプールされたサンプルを活用することで、費用対効果が高くスケーラブルな監視を可能にすること。
- シミュレーションデータとスイスからの実際の下水シークエンシングデータを用いて、手法を検証すること。
- 臨床疫学的データと一致する変異株頻度トレンドを提供することで、公衆衛生監視を支援すること。
提案手法
- 本手法は、SARS-CoV-2変異株を定義する事前に選択されたゲノム多様性(SNPs/indels)に基づく混合モデルを用いて変異株構成をモデル化する。
- 各多様性部位における観測されたリファレンスアレルとアロテルアレルカウントへの、各変異株の寄与を表す潜在変数を統合する尤度関数を採用する。
- 尤度は、変異株ごとのリードの多項分布を仮定し、推定すべきパrameterとして変異株頻度 wj を用いる。
- 最尤推定を用いて、∑wj = 1 および 0 ≤ wj ≤ 1 を満たす相対的変異株頻度のベクトル w = (w1, ..., wv) を推定する。
- 各多様性部位における総リードカウント ti = ca_i + cr_i を組み込むことで、座標間でのカバレッジのばらつきを考慮する。
- 標準誤差の推定と変異株頻度予測の不確実性の定量化のために、ブートストラップリサンプリング手法を適用する。
実験結果
リサーチクエスチョン
- RQ1統計的混合モデルは、臨床的または環境的プールサンプル内のSARS-CoV-2変異株の相対頻度を正確に推定できるか?
- RQ2低シーケンシング深度および可変なカバレッジ条件下で、このモデルの性能はいかがなものか?
- RQ3下水サンプルからの変異株頻度推定値は、臨床疫学的傾向とどの程度相関するか?
- RQ4本手法は、現実世界の状況で出現変異株を検出し、系統動態を追跡できるか?
- RQ5本手法は、変異株内での遺伝的ヘテロジェネアティーや系統間で共有される多様性に対して、どの程度頑健か?
主な発見
- 低シーケンシング深度下でも、シミュレーションデータにおいて真の変異株頻度を正確に回復でき、高い正確性と感受性を示した。
- ローザンヌおよびチューリッヒからの下水サンプルにおいて、同じ地域の臨床シークエンシングデータで観察された疫学的傾向と、推定された変異株頻度がよく一致した。
- 122個の下水サンプルの縦断的解析では、アルファ変異株の出現と減少が、地域の臨床データと整合する形で一貫して検出された。
- 変動するカバレッジと確率的サンプリングに対して本モデルの性能は頑健であり、ブートストラップに基づく不確実性推定が信頼できる予測区間を提供した。
- 本手法は、時間経過に伴うウイルス集団内での変異株の移行や優位性の変化を正確に特定でき、監視用途への有効性を確認した。
- ソフトウェアパイプラインはスケーラブルであり、VCF形式でのカスタムマーカー集合のサポートが可能で、ワークフロー・エンジンを介した並列処理が効率的に行える。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。