Skip to main content
QUICK REVIEW

[論文レビュー] Alignment-free comparison of next-generation sequencing data using compression-based distance measures

Ngoc Hieu Tran, Xin Chen|arXiv (Cornell University)|Feb 4, 2014
Genomics and Phylogenetic Studies被引用数 6
ひとこと要約

本論文は、次世代シーケンシング(NGS)短鎖配列データを比較するためのパラメータフリーでアラインメントフリーな代替手法として、圧縮に基づく距離測定法—特に正規化圧縮距離(NCD)および圧縮に基づく距離測定法(CDM)—を提案する。著者らは、k-merベースの手法とは異なり、kの最適化や配列アセンブリを必要とせず、16S rRNA、全ゲノム、メタゲノムのNGSサンプルを含む多様なゲノムデータタイプにおいて、アラインメントベースおよびk-merベースのベンチマークと高い一貫性を示すことを実証した。

ABSTRACT

Enormous volumes of short reads data from next-generation sequencing (NGS) technologies have posed new challenges to the area of genomic sequence comparison. The multiple sequence alignment approach is hardly applicable to NGS data due to the challenging problem of short read assembly. Thus alignment-free methods need to be developed for the comparison of NGS samples of short reads. Recently, new $k$-mer based distance measures such as {\it CVTree}, $d_{2}^{S}$, {\it co-phylog} have been proposed to address this problem. However, those distances depend considerably on the parameter $k$, and how to choose the optimal $k$ is not trivial since it may depend on different aspects of the sequence data. Hence, in this paper we consider an alternative parameter-free approach: compression-based distance measures. These measures have shown impressive performance on long genome sequences in previous studies, but they have not been tested on NGS short reads. In this study we perform extensive validation and show that the compression-based distances are highly consistent with those distances obtained from the $k$-mer based methods, from the alignment-based approach, and from existing benchmarks in the literature. Moreover, as these measures are parameter-free, no optimization is required and they still perform consistently well on multiple types of sequence data, for different kinds of species and taxonomy levels. The compression-based distance measures are assembly-free, alignment-free, parameter-free, and thus represent useful tools for the comparison of long genome sequences and NGS samples of short reads.

研究の動機と目的

  • アラインメントベースおよびk-merベースの手法が、計算負荷の高さとk-merサイズ依存性のため、NGS短鎖配列データの比較において抱える限界を解消するため。
  • 長配列に既に用いられている圧縮に基づく距離測定法が、NGS短鎖配列データに対しても有効に適用可能かどうかを評価するため。
  • 複数の配列アラインメント(MSA)およびk-merベースの手法(CVTree、d₂S、co-phylog)を含む、既存のベンチマークと比較して圧縮に基づく距離測定法の性能を検証するため。
  • 圧縮に基づく手法が、kのチューニングを必要とせず、異なる種や分類学的レベル、シーケンシングエラーのモデルに対しても頑健であることを示すため。

提案手法

  • 本研究では、連結された配列の相対的圧縮長に基づいて類似度を推定する正規化圧縮距離(NCD)および圧縮に基づく距離測定法(CDM)を採用する。
  • NCDは次の式で計算される:NCD(x,y) = (C(xy) - min(C(x), C(y))) / max(C(x), C(y))、ここでC(x)は配列xの圧縮サイズを表す。
  • 配列比較のためのコルモゴロフ複雑度の近似として、標準的な損失なし圧縮アルゴリズム(例:gzip、bzip2)が用いられる。
  • 本手法は、事前のアセンブリやアラインメントを経ずに、直接的に原始的なNGS短鎖データに適用され、元のデータ構造が保持される。
  • 性能評価は、系統樹再構築、パーサモニー点数、木の対称差、およびMSAベースの距離との相関を用いて行われる。
  • シミュレートされたNGS短鎖データセットは、MetaSimを用いてリファレンスゲノムから生成され、4種類のエラーモデル(454、Exact、Empirical、Sanger)を1×および5×の深度で用いた。

実験結果

リサーチクエスチョン

  • RQ1圧縮に基づく距離測定法は、アラインメントやk-merのパrameterチューニングを必要とせず、NGS短鎖配列データの信頼性の高い一貫性のある比較を可能にするか?
  • RQ2圧縮に基づく距離測定法は、アラインメントベースおよびk-merベースの手法と比較して、系統樹の正確性やベンチマーク距離との相関性において優れているか?
  • RQ3圧縮に基づく手法の性能は、16S rRNA、全ゲノム、メタゲノムなどの異なる種類のゲノムデータやシーケンシングエラーのモデルによって変動するか?
  • RQ4k-merベースの手法が最適なk選択を必要とするのに対し、圧縮に基づく手法のパラメータフリー性は実際の応用において有利であるか?

主な発見

  • 圧縮に基づく距離測定法(NCDおよびCDM)は、16S rRNA配列および全ゲノムにおいて、MSAベースの距離と高い相関(r > 0.90)を示し、ゴールドスタンダードのアラインメント手法との強い一貫性を示した。
  • 70種のGammaproteobacteria全ゲノムにおいて、CDMおよびNCDは最小の木の対称差(50〜52)とMSAとの相関が最も高く(0.93)なった。CVTreeおよびd₂Sを上回った。
  • 全ゲノムからシミュレートされたNGS短鎖配列データにおいて、CDMおよびNCDは最小のパーサモニー点数(それぞれ90および70)と、MSAとの相関が最も高く(0.60および0.58)なった。これは、シーケンシングノイズに対して頑健であることを示した。
  • メタゲノムサンプル分類において、CDMおよびNCDは最小のパーサモニー点数(それぞれ5および6)を達成し、CVTreeおよびd₂S(全データセットで10および12)を上回った。
  • 454、Exact、Empirical、Sangerの全エラーモデルにおいて、NCDの相関係数は0.77以上、CDMの相関係数は0.74以上で一貫して高く維持された。
  • k-merベースの手法とは異なり、圧縮に基づく距離測定法はパrameterチューニングを一切必要とせず、異なる種や分類学的レベルにおいても一貫して高い精度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。