Skip to main content
QUICK REVIEW

[論文レビュー] Compression of high throughput sequencing data with probabilistic de Bruijn graph

Gaëtan Benoit, Claire Lemaitre|arXiv (Cornell University)|Dec 18, 2014
Genomics and Phylogenetic Studies被引用数 5
ひとこと要約

この論文では、Bloomフィルタに格納された確率的de Bruijnグラフを用いてゲノムk-mersを表現する、高スループットシーケンシングデータ向けの新規リファレンスフリー圧縮手法Leonを紹介する。リードはk-mersのアンカーと分岐選択のリストとして符号化され、C. elegansでは0.7ビット/ベース(11倍圧縮)を達成し、一般テキスト圧縮手法とは異なり、アセンブリに由来するデータ構造を活用することで、最先端のde novoツールを上回る性能を発揮する。

ABSTRACT

Motivation: Data volumes generated by next-generation sequencing technolo- gies is now a major concern, both for storage and transmission. This triggered the need for more efficient methods than general purpose compression tools, such as the widely used gzip. Most reference-free tools developed for NGS data compression still use general text compression methods and fail to benefit from algorithms already designed specifically for the analysis of NGS data. The goal of our new method Leon is to achieve compression of DNA sequences of high throughput sequencing data, without the need of a reference genome, with techniques derived from existing assembly principles, that possibly better exploit NGS data redundancy. Results: We propose a novel method, implemented in the software Leon, for compression of DNA sequences issued from high throughput sequencing technologies. This is a lossless method that does not need a reference genome. Instead, a reference is built de novo from the set of reads as a probabilistic de Bruijn Graph, stored in a Bloom filter. Each read is encoded as a path in this graph, storing only an anchoring kmer and a list of bifurcations indicating which path to follow in the graph. This new method will allow to have compressed read files that also already contain its underlying de Bruijn Graph, thus directly re-usable by many tools relying on this structure. Leon achieved encoding of a C. elegans reads set with 0.7 bits/base, outperforming state of the art reference-free methods. Availability: Open source, under GNU affero GPL License, available for download at http://gatb.inria.fr/software/leon/

研究の動機と目的

  • 高スループットシーケンシング(HTS)データの膨大な体積を保管・送信する課題に対処する。
  • gzipのような一般用途のツールよりも、HTSデータ内の再帰的冗長性をより効果的に活用する、損失なし・リファレンスフリーの圧縮手法を開発する。
  • 圧縮ファイルに内在するde Bruijnグラフ構造を直接統合し、下流解析で即座に再利用可能にする。
  • テキスト圧縮ヒューリスティクスではなく、アセンブリの原則(特に確率的de Bruijnグラフ)を用いることで、優れた圧縮比を達成する。

提案手法

  • k-mersのサイズkを用いて入力リードからde novoの確率的de Bruijnグラフを構築し、ノードをBloomフィルタに格納することでメモリ使用量を削減する。
  • 各リードを、k-mersのアンカーと、経路走査の意思決定を示す分岐選択の系列として、グラフ内のパスとして符号化する。
  • 算術符号化を用いて分岐情報を効率的に圧縮し、平均して各分岐に約2ビットを要する。
  • 理論的推定(ゲノムサイズとk-mersの深さに基づく)を用いて、偽陽性率(余分な分岐を引き起こす)とストレージコストのバランスを取るためのBloomフィルターサイズを最適化する。
  • 復元時に、アンカーから出発して保存済みの分岐リストに従ってグラフを走査することでリードを再構築する。
  • マルチスレッド処理による並列化をサポートし、メモリアクセスパターンの特性上、Intelハイパースレービング環境で性能向上が確認された。

実験結果

リサーチクエスチョン

  • RQ1確率的de Bruijnグラフに基づくde novo圧縮手法は、既存のリファレンスフリー手法を上回る圧縮比を達成できるか?
  • RQ2リファレンスゲノムなしで、アセンブリ由来のデータ構造は、HTS DNA配列の損失なし圧縮をどの程度向上できるか?
  • RQ3Bloomフィルターサイズと偽陽性に起因する分岐オーバーヘッドのトレードオフは、全体の圧縮効率にどのように影響するか?
  • RQ4圧縮ファイルがネイティブに再利用可能なde Bruijnグラフを埋め込めるか、再計算の必要を減らせるか?

主な発見

  • C. elegansの70倍全ゲノムシーケンシングデータセットに対して、Leonは0.7ビット/ベースの圧縮比を達成し、11倍の圧縮を実現した。
  • E. coliデータセットでは、Leonは0.49ビット/ベースを達成し、16倍の圧縮比を示した。
  • WGS、エクソン、RNA-seq、メタゲノムデータなど、複数のデータセットにおいて、fastqz、fqzcomp、scalce、Quipといった最先端のリファレンスフリーツールを上回った。
  • C. elegansデータセットの実験結果とよく一致するように、k-mersの深さが50の場合、最適なBloomフィルターサイズは理論的に10.3ビット/要素と推定された。
  • Leonは最大24CPUスレッドまでスケーラビリティを示し、メモリアクセスパターンのおかげでIntelハイパースレービング環境で顕著な性能向上を示した。
  • 圧縮ファイルには自己完結的かつ利用可能なde Bruijnグラフが埋め込まれており、この構造を必要とするツールでの即時再利用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。