Skip to main content
QUICK REVIEW

[論文レビュー] Lossy Compression of Quality Values via Rate Distortion Theory

Himanshu Asnani, Dinesh Bharadia|arXiv (Cornell University)|Jul 21, 2012
Algorithms and Data Compression参考文献 25被引用数 5
ひとこと要約

本稿では、FASTQ遺伝子シーケンシングファイル内の品質値の損失圧縮のためのレート・ディストーション最適化フレームワークを提案する。連続ドメインの量子化モデルを用いることで、品質値1つあたり1ビット未塔の圧縮が可能である。この手法は、下流のアライメント精度に最小限の影響を与える一方で、高い圧縮効率を達成しており、損失圧縮が生物学的有用性を保持しつつ、ストレージおよび伝送コストを大幅に削減できることを示している。

ABSTRACT

Motivation: Next Generation Sequencing technologies revolutionized many fields in biology by enabling the fast and cheap sequencing of large amounts of genomic data. The ever increasing sequencing capacities enabled by current sequencing machines hold a lot of promise as for the future applications of these technologies, but also create increasing computational challenges related to the analysis and storage of these data. A typical sequencing data file may occupy tens or even hundreds of gigabytes of disk space, prohibitively large for many users. Raw sequencing data consists of both the DNA sequences (reads) and per-base quality values that indicate the level of confidence in the readout of these sequences. Quality values account for about half of the required disk space in the commonly used FASTQ format and therefore their compression can significantly reduce storage requirements and speed up analysis and transmission of these data. Results: In this paper we present a framework for the lossy compression of the quality value sequences of genomic read files. Numerical experiments with reference based alignment using these quality values suggest that we can achieve significant compression with little compromise in performance for several downstream applications of interest, as is consistent with our theoretical analysis. Our framework also allows compression in a regime - below one bit per quality value - for which there are no existing compressors.

研究の動機と目的

  • 次世代シーケンシング(NGS)データの増大するストレージおよび計算負荷に対処するため、特にFASTQファイル内の品質値シーケンスの巨大なサイズに焦点を当てる。
  • 情報損失があっても下流の応用性能を維持する品質値の損失圧縮フレームワークを開発すること。
  • 1品質値あたり1ビット未塔の圧縮レートを達成すること。これは、従来の圧縮器がカバーしなかったレジームである。
  • 品質値の歪みがアライメントおよびバリアントコールの性能に最小限の低下しか与えないことの理論的および実験的妥当性を検証すること。
  • 損失圧縮がノイズ除去の一種として機能し、品質スコアのノイズを除去することで、SNP検出や配列アセンブリなどの下流応用の精度を向上させる可能性があるかどうかを検討すること。

提案手法

  • 品質値シーケンスを連続確率変数としてモデル化し、信号の顕著な変動にビットを割り当てるためのレート・ディストーション最適化を適用する。
  • 圧縮問題を制約付き最適化問題(問題8)として定式化し、ビットレート制約の下で平均二乗誤差(MSE)を最小化する。
  • 非常に低いレートでも理論的解析と最適なビット割り当てが可能な連続量子化モデルを採用する。
  • 実際のNGSデータを用いてBowtieを用いた下流のアライメント評価を行い、損失なし圧縮およびビンニングベースの量子化手法と性能を比較する。
  • 平均品質値のみを保存することでゼロレート動作を可能とし、大規模データセットでは1リードあたりの平均コストが漸近的にゼロとなる。
  • フレームワークは実装済みであり、http://www.stanford.edu/~mainakch/svdbit.tgz で公開されている。

実験結果

リサーチクエスチョン

  • RQ1FASTQファイル内の品質値の損失圧縮は、下流のアライメント精度にほとんど影響を与えないまま、顕著なストレージ削減を達成できるか?
  • RQ21品質値あたり1ビット未塔の圧縮レートを達成することは可能であり、そのような圧縮は生物学的解析に有用なままであるか?
  • RQ3提案されたレート・ディストーション最適化量子化は、従来のビンニングベースやヒューリスティック圧縮方式に比べ、歪みとアライメント忠実度の面で優れているか?
  • RQ4品質値の損失圧縮はノイズ除去の一種として機能し、SNP検出や配列アセンブリなどの下流応用の精度を向上させる可能性があるか?
  • RQ5ビット割り当ての増加に伴う圧縮方式の性能変化はどのように推移するか?ノイズ抑制の影響により、単調増加でない挙動を示す可能性はあるか?

主な発見

  • 提案手法は、特に1品質値あたり1ビット未塔の低レート域において、従来のビンニングベース量子化器(例:ログビンニング)よりも顕著に低い平均二乗誤差(MSE)を達成している。
  • 0.5ビット/品質値でも、損失なし圧縮と同等のアライメント性能を維持しており、マッピング精度の低下は5%未塔にとどまっている。
  • 6ビット/品質値のレートでは、損失なし圧縮が達成されており、高レート域における理論的最適性が裏付けられている。
  • すべてのビットレートで、元の品質値と圧縮済み品質値を用いたマッピングリード間の対称差が低く保たれていることから、アライメント忠実度が堅牢であることが示された。
  • ゼロレート設定(平均品質値のみを保存)でも、意味のあるアライメント性能が得られており、品質値を完全に破棄した場合よりも優れている。
  • 結果から、レート制限が品質スコアのノイズ除去に寄与する可能性があることが示唆されるが、これはレート増加に伴い単調でない挙動を示す可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。