Skip to main content
QUICK REVIEW

[論文レビュー] Compressed Weighted de Bruijn Graphs

Italiano, Giuseppe F., Prezza, Nicola|arXiv (Cornell University)|Aug 9, 2013
Chromosomal and Genetic Variations参考文献 9被引用数 465
ひとこと要約

本稿では、k-mer頻度分布を用いて、アセンブリに依存しない新規手法を提示し、ゲノムサイズ、繰り返し配列含有量、ヘテロ接合性を推定する。k-mer個体の統合、浮動小数点精度推定、シークエンシングエラーおよびカバレッジバイアスの強力な処理を統合することで、従来手法に比べて著しく精度が向上し、シミュレートデータにおいてゲノムサイズ推定誤差が8.11%未満に抑えられ、実際のデノボシーケンシングプロジェクトにおいても実用的であることが示された。

ABSTRACT

Background: With the fast development of next generation sequencing technologies, increasing numbers of genomes are being de novo sequenced and assembled. However, most are in fragmental and incomplete draft status, and thus it is often difficult to know the accurate genome size and repeat content. Furthermore, many genomes are highly repetitive or heterozygous, posing problems to current assemblers utilizing short reads. Therefore, it is necessary to develop efficient assembly-independent methods for accurate estimation of these genomic characteristics. Results: Here we present a framework for modeling the distribution of k-mer frequency from sequencing data and estimating the genomic characteristics such as genome size, repeat structure and heterozygous rate. By introducing novel techniques of k-mer individuals, float precision estimation, and proper treatment of sequencing error and coverage bias, the estimation accuracy of our method is significantly improved over existing methods. We also studied how the various genomic and sequencing characteristics affect the estimation accuracy using simulated sequencing data, and discussed the limitations on applying our method to real sequencing data. Conclusion: Based on this research, we show that the k-mer frequency analysis can be used as a general and assembly-independent method for estimating genomic characteristics, which can improve our understanding of a species genome, help design the sequencing strategy of genome projects, and guide the development of assembly algorithms. The programs developed in this research are written using C/C++, and freely accessible at Github URL (https://github.com/fanagislab/GCE) or BGI ftp ( ftp://ftp.genomics.org.cn/pub/gce).

研究の動機と目的

  • 本稿の目的は、デノボシーケンシングプロジェクトにおける現在のゲノムサイズおよび繰り返し配列含有量推定手法の限界を解決することにある。
  • シークエンシングエラーおよびカバレッジバイアスの処理を強化した手法を用いて、k-mer頻度分布をモデル化することで、推定精度の向上を図る。
  • 本研究では、ゲノムプロジェクトにおいてしばしば無視されがちな重要なパラメータであるヘテロ接合率推定を、既存手法に拡張している。
  • シミュレートデータを用いて、k-merサイズ、エラー率、ヘテロ接合性といった、主要なゲノム的およびシークエンシング要因が推定精度に与える影響を評価する。
  • 本目的には、大規模ゲノムプロジェクトにおけるシークエンシング戦略やアセンブリアルゴリズム選定を支援する実用的でアクセス可能なツールセットの提供が含まれる。

提案手法

  • 本手法は、複合ポisson混合モデルを用いてk-mer頻度分布をモデル化し、一意、反復的、ヘテロ接合的k-merクラスを区別する。
  • k-mer個体を導入し、異なるゲノム的k-mer種を表現し、整数ベースの手法に比べて解像度を向上させる浮動小数点精度推定を用いる。
  • 反復的EMに類似した更新を用いるベイズ推定フレームワークを採用し、カバレッジ深さ(c)、ゲノム頻度(ai)、k-mer種の割合(ka)などのパラメータを推定する。
  • シークエンシングエラーは経験則に基づくフィルタリング手法で処理し、深さのしきい値未満のk-mersを除外し、欠損率の反復的再キャリブレーションを行う。
  • カバレッジバイアスは、バイアス下でもk-mer深さ分布の主ピークが依然として真のカバレッジ深さ(c)を反映すると仮定することで処理する。
  • 連続的なポisson混合を近似可能な高密度離散モデルを用いることで、効率的な計算とパラメータ推定を実現する。

実験結果

リサーチクエスチョン

  • RQ1k-merサイズが、変動するエラー率およびヘテロ接合性率下でのゲノムサイズおよび繰り返し配列含有量推定の精度に与える影響は何か?
  • RQ2シークエンシングエラーおよびカバレッジバイアスが、k-mer頻度ベースの推定精度に及ぼす影響の程度はどの程度か?
  • RQ3提案手法は、ドーピングゲノムのk-mer頻度分布から、信頼性を持ってヘテロ接合率を推定できるか?
  • RQ4k-mer頻度分布のパラメータ(例:ピーク深さ、形状)と、ゲノムサイズや繰り返し構造といった真のゲノム的特性との相関は何か?
  • RQ5本手法を実際のシークエンシングデータに適用する際の実用的限界は何か。特に、カバレッジバイアスや低カバレッジ領域が存在する場合にどうなるか?

主な発見

  • シミュレートデータにおいて、本手法は最大で8.11%のゲノムサイズ推定誤差を達成した。主に25-mer k-mersを用い、1%のエラー率および1%のヘテロ接合性条件下で観察された。
  • フィルタリングを施した実データを用いたゲノムサイズ推定において、22%の結果が1%未満の誤差、80%が5%未満の誤差を示しており、実用的性能が顕著に高いことが示された。
  • 繰り返し配列含有量推定(a1)における最大誤差は12.6%であり、17-mersを用い、0.1%のヘテロ接合性および1%のエラー率でトウモロコシで観察された。
  • 実データ解析において、a1推定値の17%が1%未満の誤差、80%が5%未満の誤差を示しており、現実のノイズ下でも一貫した精度の傾向を示した。
  • 十分な深さのデータではヘテロ接合ピーク(c/2)を正しく検出でき、明確な二峰性分布が存在する場合には、粗いヘテロ接合率推定が可能となった。
  • 本研究では、大きなk-merサイズ(例:25-mer)がエラーおよびヘテロ接合性に対して感受性が高く、精度を低下させることが確認された。一方、小さなk-mers(例:17-mer)はノイズの多い条件下でもより高いロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。