Skip to main content
QUICK REVIEW

[논문 리뷰] Compression of high throughput sequencing data with probabilistic de Bruijn graph

Gaëtan Benoit, Claire Lemaitre|arXiv (Cornell University)|2014. 12. 18.
Genomics and Phylogenetic Studies인용 수 5
한 줄 요약

이 논문은 고속 시퀀싱 데이터를 위한 참조 미사용 압축 방법인 Leon을 소개한다. 이 방법은 블룸 필터에 저장된 확률적 de Bruijn 그래프를 사용하여 게놈 k-머를 표현하며, 리드를 k-머 앵커와 분岐 선택 목록으로 인코딩하여 C. elegans에 대해 0.7 비트/기본서열을 달성한다(11배 압축). 기존 최고 수준의 de novo 도구를 능가하며, 일반 텍스트 압축 기법이 아닌 어셈블리 기반 데이터 구조를 활용한다.

ABSTRACT

Motivation: Data volumes generated by next-generation sequencing technolo- gies is now a major concern, both for storage and transmission. This triggered the need for more efficient methods than general purpose compression tools, such as the widely used gzip. Most reference-free tools developed for NGS data compression still use general text compression methods and fail to benefit from algorithms already designed specifically for the analysis of NGS data. The goal of our new method Leon is to achieve compression of DNA sequences of high throughput sequencing data, without the need of a reference genome, with techniques derived from existing assembly principles, that possibly better exploit NGS data redundancy. Results: We propose a novel method, implemented in the software Leon, for compression of DNA sequences issued from high throughput sequencing technologies. This is a lossless method that does not need a reference genome. Instead, a reference is built de novo from the set of reads as a probabilistic de Bruijn Graph, stored in a Bloom filter. Each read is encoded as a path in this graph, storing only an anchoring kmer and a list of bifurcations indicating which path to follow in the graph. This new method will allow to have compressed read files that also already contain its underlying de Bruijn Graph, thus directly re-usable by many tools relying on this structure. Leon achieved encoding of a C. elegans reads set with 0.7 bits/base, outperforming state of the art reference-free methods. Availability: Open source, under GNU affero GPL License, available for download at http://gatb.inria.fr/software/leon/

연구 동기 및 목표

  • 고속 시퀀싱(HTS) 데이터의 저장 및 전송에 증가하는 도전 과제를 해결한다.
  • gzip와 같은 일반 목적 도구보다 더 효과적으로 HTS 데이터의 부복을 활용하는 손실 없는 參조 미사용 압축 방법을 개발한다.
  • 기본적으로 de Bruijn 그래프의 구조를 압축 파일에 직접 통합하여 즉각적인 후속 분석 재사용을 가능하게 한다.
  • 텍스트 압축 히وري스틱이 아닌 어셈블리 원칙—특히 확률적 de Bruijn 그래프—를 사용하여 더 뛰어난 압축 비율을 달성한다.

제안 방법

  • 입력 리드에서 k-머 크기 k를 사용하여 비밀리에 확률적 de Bruijn 그래프를 구축하고, 노드를 블룸 필터에 저장하여 메모리 사용량을 줄인다.
  • 각 리드를 그래프 내 경로로 인코딩하며, k-머 앵커와 분岐 선택의 시퀀스를 사용하여 경로 탐색 결정을 나타낸다.
  • 분岐 정보를 효율적으로 압축하기 위해 산술 압축을 사용하며, 평균적으로 각 분岐에 약 2비트가 소요된다.
  • 가짜 긍정률(추가 분岐 유도)과 저장 비용 간의 균형을 맞추기 위해 이론적 추정을 기반으로 블룸 필터 크기를 최적화하며, 게놈 크기와 k-머 깊이를 고려한다.
  • 압축 해제 시, 앵커에서 시작하여 저장된 분岐 목록을 사용해 그래프를 따라가면서 리드를 재구성한다.
  • 다중 스레드 처리를 통해 병렬 처리를 지원하며, 메모리 액세스 패턴으로 인해 인텔 하이퍼스레딩 환경에서 성능 향상을 관찰할 수 있다.

실험 결과

연구 질문

  • RQ1기본적으로 확률적 de Bruijn 그래프를 기반으로 한 압축 방법이 기존의 參조 미사용 도구보다 더 뛰어난 압축 비율을 달성할 수 있는가?
  • RQ2어셈블리 기반 데이터 구조는 參조 게놈 없이도 HTS DNA 서열의 손실 없는 압축을 얼마나 향상시킬 수 있는가?
  • RQ3블룸 필터 크기와 가짜 긍정으로 인한 분岐 오버헤드 간의 트레이드오프가 전체 압축 효율성에 어떤 영향을 미치는가?
  • RQ4압축 파일이 내재적으로 사용 가능한 de Bruijn 그래프를 포함하여 후속 분석에서 재사용을 줄일 수 있는가?

주요 결과

  • Leon은 C. elegans 70x 전장 게놈 시퀀싱 데이터셋에 대해 0.7 비트/기본서열의 압축 비율을 달성하여 11배의 압축을 이룬다.
  • E. coli 데이터셋에 대해서는 0.49 비트/기본서열을 기록하여 16배의 압축 비율을 달성한다.
  • WGS, 엑스옴, RNA-seq, 메타게놈 데이터를 포함한 여러 데이터셋에서 기존 최고 수준의 參조 미사용 도구인 fastqz, fqzcomp, scalce, Quip를 능가했다.
  • C. elegans 데이터셋에 대해 k-머 깊이 50일 때 이론적으로 최적의 블룸 필터 크기는 10.3 비트/요소로 추정되었으며, 실험 결과와 매우 유사하게 일치했다.
  • Leon은 최대 24개의 CPU 스레드까지 우수한 확장성을 보였으며, 메모리 액세스 패턴으로 인해 인텔 하이퍼스레딩 환경에서 뚜렷한 성능 향상을 보였다.
  • 압축 파일은 자가 통합된 사용 가능한 de Bruijn 그래프를 포함하고 있어, 이 구조에 의존하는 도구에서 즉각적인 재사용이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.