Skip to main content
QUICK REVIEW

[논문 리뷰] Alignment-free comparison of next-generation sequencing data using compression-based distance measures

Ngoc Hieu Tran, Xin Chen|arXiv (Cornell University)|2014. 02. 04.
Genomics and Phylogenetic Studies인용 수 6
한 줄 요약

이 논문은 다음세대 시퀀싱(NGS) 단일서열 데이터를 비교하기 위한 매개변수 없는, 정렬 기반 방법의 대안으로 압축 기반 거리 측정법—특히 정규화된 압축 거리(NCD)와 압축 기반 거리 측정법(CDM)—을 제안한다. 저자들은 이러한 압축 기반 방법이 16S rRNA, 전체 게놈, 메타게놈 NGS 샘플을 포함한 다양한 게놈 데이터 유형에서 정렬 기반 및 k-mer 기반 기준과 높은 일致성을 보이며, k나 서열 조립 최적화가 필요하지 않다는 것을 입증한다.

ABSTRACT

Enormous volumes of short reads data from next-generation sequencing (NGS) technologies have posed new challenges to the area of genomic sequence comparison. The multiple sequence alignment approach is hardly applicable to NGS data due to the challenging problem of short read assembly. Thus alignment-free methods need to be developed for the comparison of NGS samples of short reads. Recently, new $k$-mer based distance measures such as {\it CVTree}, $d_{2}^{S}$, {\it co-phylog} have been proposed to address this problem. However, those distances depend considerably on the parameter $k$, and how to choose the optimal $k$ is not trivial since it may depend on different aspects of the sequence data. Hence, in this paper we consider an alternative parameter-free approach: compression-based distance measures. These measures have shown impressive performance on long genome sequences in previous studies, but they have not been tested on NGS short reads. In this study we perform extensive validation and show that the compression-based distances are highly consistent with those distances obtained from the $k$-mer based methods, from the alignment-based approach, and from existing benchmarks in the literature. Moreover, as these measures are parameter-free, no optimization is required and they still perform consistently well on multiple types of sequence data, for different kinds of species and taxonomy levels. The compression-based distance measures are assembly-free, alignment-free, parameter-free, and thus represent useful tools for the comparison of long genome sequences and NGS samples of short reads.

연구 동기 및 목표

  • 정렬 기반 및 k-mer 기반 방법의 한계—특히 계산 부담과 k-mer 크기 의존성으로 인한 문제를 해결하기 위해.
  • 이전에 긴 서열에 사용된 압축 기반 거리 측정법이 NGS 단일서열 데이터에 효과적으로 적용될 수 있는지 평가하기 위해.
  • 다중 서열 정렬(MSA) 및 CVTree, d₂S, co-phylog와 같은 k-mer 기반 방법을 포함한 기존 기준과의 성능을 검증하기 위해.
  • 압축 기반 방법이 매개변수 조정 없이 다양한 종, 분류학적 수준, 시퀀싱 오류 모델에서 강건하게 유지되는지 입증하기 위해.

제안 방법

  • 연구는 정규화된 압축 거리(NCD)와 압축 기반 거리 측정법(CDM)을 사용하며, 이는 연결된 서열의 상대적 압축 길이를 기반으로 서열 유사도를 추정한다.
  • NCD는 다음 공식으로 계산된다: NCD(x,y) = (C(xy) - min(C(x), C(y))) / max(C(x), C(y)), 여기서 C(x)는 서열 x의 압축 크기이다.
  • 서열 비교를 위해 표준 손실 없는 압축 알고리즘(gzip, bzip2 등)을 사용하여 콜모고로프 복잡도를 근사한다.
  • 이 방법은 사전 조립 또는 정렬 없이 원시 NGS 단일서열 데이터에 직접 적용되어 원래 데이터 구조를 유지한다.
  • 성능 평가는 계통수 재구성, 최소 복잡도 점수, 트리 대칭 차이, MSA 기반 거리와의 상관관계를 통해 평가된다.
  • 모의 NGS 단일서열 데이터셋은 MetaSim을 사용하여 기준 게놈에서 생성되었으며, 1× 및 5× 깊이에서 4가지 오류 모델(454, Exact, Empirical, Sanger)을 사용하였다.

실험 결과

연구 질문

  • RQ1압축 기반 거리 측정법이 서열 정렬이나 k-mer 매개변수 조정 없이도 신뢰할 수 있고 일관성 있게 NGS 단일서열 데이터를 비교할 수 있는가?
  • RQ2압축 기반 거리 측정법이 정렬 기반 및 k-mer 기반 방법과 비교해 계통수 정확도와 기준 거리와의 상관관계에서 어떻게 성능을 내는가?
  • RQ3압축 기반 방법의 성능은 16S rRNA, 전체 게놈, 메타게놈과 같은 다양한 유형의 게놈 데이터 및 시퀀싱 오류 모델에서 어떻게 달라지는가?
  • RQ4k-mer 기반 방법이 최적의 k 선택이 필요로 하는 반면, 압축 기반 방법의 매개변수 없는 특성이 실제로 유리한가?

주요 결과

  • 압축 기반 거리(NCD 및 CDM)는 16S rRNA 서열과 전체 게놈에서 MSA 기반 거리와 높은 상관관계(r > 0.90)를 보이며, 황금 표준 정렬 방법과의 강력한 일치성을 나타낸다.
  • 70개의 감마프로테오박터 게놈에서 CDM와 NCD는 트리 대칭 차이가 가장 낮고(50–52), MSA와의 상관계수가 가장 높았으며(0.93), CVTree 및 d₂S를 능가했다.
  • 전체 게놈에서 모의된 NGS 단일서열 데이터에서 CDM와 NCD는 최소 복잡도 점수(각각 90 및 70)가 가장 낮고, MSA와의 상관계수가 가장 높았으며(각각 0.60 및 0.58), 시퀀싱 노이즈에 대한 강건성을 입증했다.
  • 메타게놈 샘플 분류에서 CDM와 NCD는 최소 복잡도 점수가 가장 낮았으며(각각 5 및 6), CVTree 및 d₂S(전체 데이터셋에서 각각 10 및 12)를 능가했다.
  • 압축 기반 방법은 모든 오류 모델(454, Exact, Empirical, Sanger)에서 높은 성능를 유지했으며, NCD의 상관계수는 항상 0.77 이상, CDM는 0.74 이상이었다.
  • k-mer 기반 방법과 달리, 압축 기반 거리 측정법은 매개변수 조정이 필요 없었으며, 다양한 종과 분류학적 수준에서 일관된 정확도를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.