Skip to main content
QUICK REVIEW

[論文レビュー] Barcoding-free BAC Pooling Enables Combinatorial Selective Sequencing of the Barley Gene Space

Stefano Lonardi, Denisa Duma|arXiv (Cornell University)|Dec 19, 2011
Genomics and Phylogenetic Studies参考文献 37被引用数 3
ひとこと要約

本論文は、バクテリア配列クローン(BAC)の選択的シークエンシングのための、バーコードフリーな組み合わせ的プール戦略を提案する。プールパターンを用いてBACのアイデンティティを符号化し、計算的手法による割り当てにより短いリードを正確にデコンボリューション可能である。この手法は、ライスデータでは99.57%のデコンボリューション精度を達成し、ハワイのBACでは平均88%のBACカバレッジを示しており、遺伝子豊富なクローンの大量デノボゲノムシークエンシングにおけるDNAバーコードの代替手段として、費用対効果に優れ、スケーラブルであることを示している。

ABSTRACT

We propose a new sequencing protocol that combines recent advances in combinatorial pooling design and second-generation sequencing technology to efficiently approach de novo selective genome sequencing. We show that combinatorial pooling is a cost-effective and practical alternative to exhaustive DNA barcoding when dealing with hundreds or thousands of DNA samples, such as genome-tiling gene-rich BAC clones. The novelty of the protocol hinges on the computational ability to efficiently compare hundreds of million of short reads and assign them to the correct BAC clones so that the assembly can be carried out clone-by-clone. Experimental results on simulated data for the rice genome show that the deconvolution is extremely accurate (99.57% of the deconvoluted reads are assigned to the correct BAC), and the resulting BAC assemblies have very high quality (BACs are covered by contigs over about 77% of their length, on average). Experimental results on real data for a gene-rich subset of the barley genome confirm that the deconvolution is accurate (almost 70% of left/right pairs in paired-end reads are assigned to the same BAC, despite being processed independently) and the BAC assemblies have good quality (the average sum of all assembled contigs is about 88% of the estimated BAC length).

研究の動機と目的

  • 高スループットBACシークエンシングにおける包括的DNAバーコードのスケーラビリティおよびコストの制限を克服すること。
  • 数100〜数1000のBACクローンを効率的にシーケンスするための実用的でバーコードフリーな代替手法を開発すること。
  • 固有のバーコードに依存せずに、短いリードを個々のBACクローンに正確にデコンボリューションすること。
  • 組み合わせ的プールと2世代シークエンシングを用いて、クローンごとの高品質なアセンブリを実現すること。
  • 本手法の妥当性と正確性を確認するため、シミュレーテッドライスデータおよび実際のハワイBACデータの両方で検証すること。

提案手法

  • 各BACが固有のプールの組み合わせにのみ存在するように、重複するプールを含むBACクローンの組み合わせ的プール設計を実施する。
  • 各プールを個別に2世代シークエンシングでシーケンスし、プールパターンを識別子として持つ短いリードを生成する。
  • 計算的手法によるデコンボリューションパイプラインを用い、リードが検出されたプールの交差に基づいて、各リードの元のBACを同定する。
  • 各BACのデコンボリュートされたリードは、VelvetやSOAPDenovoなどのアセンブラを用いてクローンごとのアセンブリが行われる。
  • デコンボリューション精度の向上と高速化を図るため、ハッシュベースのアルゴリズム(例:HashFilter)を活用する。
  • 組み合わせ数学を用いて、曖昧さを最小限に抑え、BACの固有同一定位を最大化するようにプール設計を最適化する。

実験結果

リサーチクエスチョン

  • RQ1組み合わせ的プールは、コスト効率的かつスケーラブルな形で、大規模BACシークエンシングにおける包括的DNAバーコードの代替手段として機能できるか?
  • RQ2バーコードではなくプールパターンを用いることで、短いリードをその元のBACクローンにどれほど正確にデコンボリュートできるか?
  • RQ3デコンボリューション後のクローンごとの再構築により得られるBACアセンブリの品質はどの程度か?
  • RQ4実際のハワイBACデータでは、シミュレーテッドライスデータと比較して、本手法はどの程度の性能を示すか?
  • RQ5数千のBACにスケーリングした場合でも、リード割り当て精度とアセンブリ品質を維持できるか?

主な発見

  • シミュレーテッドライスデータでは、99.57%のリードが正しくその元のBACに割り当てられた。
  • 実際のハワイデータでは、ペアエンドリードペアの69.7%が同じBACに割り当てられており、独立した処理にもかかわらず高い一貫性を示した。
  • 平均BACアセンブリは、推定されたBAC長の88%をカバーしており、高品質なクローン固有の再構築を示している。
  • ハワイゲノム全体(2,197 BAC)において、本手法はターゲットサイズに対して25.3%のリード使用率と、56.6%のコンティグサイズ合計を達成した。
  • 個々のバーコード化の必要性を排除することで、シーケンシングコストと複雑さを低減したが、高い正確性を維持した。
  • 本手法は、合成ライスデータおよび実際のハワイデータの両方で検証され、両データセットで一貫した性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。