Skip to main content
QUICK REVIEW

[論文レビュー] Maximum Likelihood de novo reconstruction of viral populations using paired end sequencing data

Raunaq Malhotra, Manjari Mukhopadhyay Steven Wu|arXiv (Cornell University)|Feb 14, 2015
Genomics and Phylogenetic Studies参考文献 20被引用数 12
ひとこと要約

MLEHaplo は、De Bruijn グラフ上で新しいパス探索アルゴリズム(ViPRA)を用いて、ペアエンド NGS データからウイルスヘプロタイプを最大尤度推定で再構築するデノボアセンブリ手法である。シミュレートされたデータでは 250x のシーケンス深度で真のヘプロタイプと 100% の相同性を達成し、リファレンスベース手法に比べ過剰推定を低減し、HIV-1 や HCV 群においてより多くの遺伝的多様性を捉えている。

ABSTRACT

We present MLEHaplo, a maximum likelihood de novo assembly algorithm for reconstructing viral haplotypes in a virus population from paired-end next generation sequencing (NGS) data. Using the pairing information of reads in our proposed Viral Path Reconstruction Algorithm (ViPRA), we generate a small subset of paths from a De Bruijn graph of reads that serve as candidate paths for true viral haplotypes. Our proposed method MLEHaplo then generates a maximum likelihood estimate of the viral population using the paths reconstructed by ViPRA. We evaluate and compare MLEHaplo on simulated datasets of 1200 base pairs at different sequence coverage, on HCV strains with sequencing errors, and on a lab mixture of five HIV-1 strains. MLEHaplo reconstructs full length viral haplotypes having a 100% sequence identity to the true viral haplotypes in most of the small genome simulated viral populations at 250x sequencing coverage. While reference based methods either under-estimate or over-estimate the viral haplotypes, MLEHaplo limits the over-estimation to 3 times the size of true viral haplotypes, reconstructs the full phylogeny in the HCV to greater than 99% sequencing identity and captures more sequencing variation for the HIV-1 strains dataset compared to their known consensus sequences.

研究の動機と目的

  • リファレンスゲノムに依存せずにウイルスヘプロタイプを再構築する課題に対処すること。
  • シーングエラーとアラインメントの誤りにより、リファレンスベース手法が頻繁にヘプロタイプ多様性を過剰に推定するという限界を克服すること。
  • 真の系統発生とウイルスクオアジスペシーズ内の遺伝的多様性を正確に捉えるデノボ手法を開発すること。
  • ペアエンドシーケンシング情報を活用して、De Bruijn グラフにおけるパス選択を改善し、より正確なヘプロタイプ再構築を実現すること。
  • 誤検出のヘプロタイプコールを最小限に抑え、多様なウイルス群における真のウイルスヘプロタイプとの相同性を向上させること。

提案手法

  • この手法は、ペアエンドリードの k マーライクスから構築された De Bruijn グラフを用いて、ウイルス集団を表現する。
  • ViPRA はトップ M パスアルゴリズムであり、各頂点からユニバーサルシンクへとグラフを走査することで、尤度スコアが高く、候補ヘプロタイプパスを特定する。
  • パススコアは、配列尤度、挿入サイズ制約、および仮定される真のパスペア集合(PS)への属性に基づいて計算され、整合性のないまたは長いパスに対してペナルティが課される。
  • アルゴリズムはバックワードエリミネーションとメモ化を適用して、各頂点ごとのトップ M パスを効率的に計算し、計算オーバーヘッドを低減する。
  • MLEHaplo は ViPRA が生成した候補パスから最大尤度推定値を選択し、相同性と系統発生の正確性を最適化する。
  • この手法はペアエンドリード情報を統合して、パス選択のあいまいさを解消し、再構築の正確性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ペアエンド NGS データを用いたリファレンスフリーのデノボ手法は、完全長のウイルスヘプロタイプを高い相同性で再構築できるか?
  • RQ2MLEHaplo はリファレンスベース手法と比較して、ヘプロタイプ多様性の過剰推定の程度はどうなるか?
  • RQ3MLEHaplo は HCV や HIV-1 のようなウイルス集団の完全な系統発生をどの程度回復できるか?
  • RQ4ViPRA アルゴリズムは、複雑な De Bruijn グラフから生物学的に妥当なパスを効率的に選択できるか?
  • RQ5ペアエンドリード情報の統合は、単一エンドアプローチと比較して、ヘプロタイプ再構築の正確性を顕著に向上させるか?

主な発見

  • MLEHaplo は、250x の深さでほとんどのシミュレートされた集団において、真のヘプロタイプと 100% の相同性を持つ完全長のウイルスヘプロタイプを再構築した。
  • この手法は、ヘプロタイプの過剰推定を真の数の 3 倍までに制限し、リファレンスベース手法と比較して誤検出を顕著に低減した。
  • HCV ストレインにおいて、MLEHaplo は真の集団構造と 99% 以上の相同性を持つ完全な系統発生を再構築した。
  • 5 つの株からなる HIV-1 ラボミックスでは、MLEHaplo は既知のコンSENSUS配列よりも多くの遺伝的多様性を捉えており、マイノリティヘプロタイプの解像度が優れていることを示した。
  • ViPRA アルゴリズムは、De Bruijn グラフ内で尤度の高いパスを効率的に特定でき、正確な後続の最大尤度推定を可能にした。
  • この手法は、高い突然変異率や再結合を伴うウイルス集団を含め、多様なウイルス群においても頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。