Skip to main content
QUICK REVIEW

[論文レビュー] Hot RAD: A Tool for Analysis of Next-Gen RAD Tag Data

Lauren A. Assour, Nicholas LaRosa|arXiv (Cornell University)|Nov 20, 2015
Genomics and Phylogenetic Studies参考文献 8被引用数 3
ひとこと要約

Hot RAD は、Smith-Waterman に基づくクラスタリングおよびコンSENSス配列生成を用いて、原始的な Illumina 読み取りデータからより少ない数、より深い配列スタックを生成する、GUI 対応で分散処理可能なパイプラインです。既存のツールと比較してデータ使用率を向上させ、メモリ使用量を削減し、可変フィルタリングと Makeflow や Weaver を用いた分散実行をサポートする、シングルエンドおよびペアエンド読み取りを対応しています。

ABSTRACT

Restriction site Associated DNA (RAD) tagging (also known as RAD-seq, etc.) is an emerging method for analyzing an organism's genome without completely sequencing it. This can be applied to a non-model organism without a reference genome, though this creates the problem of how to begin data analysis on unmapped and unannotated reads. Our program, Hot RAD, presents a straightforward and easy-to-use method to take raw Illumina data that has been RAD tagged and produce consensus contigs or sequence stacks using a distributed framework, creating a basis on which to begin analyzing an organism's DNA. The GUI (graphical user interface) element of our tool makes it easy for those not familiar with the command line to take raw sequence files and produce usable data in a timely manner.

研究の動機と目的

  • リファレンスゲノムのない非モデル生物からのマッピング不能でアノテーションのない RAD タグシーケンシングデータを分析する課題に対処すること。
  • 従来のデノボアセンブリとは異なり、読み取りをより少ない数、より深い配列スタックにクラスタリングすることで、メモリ使用量を削減し、データ利用効率を向上させること。
  • 非専門家研究者でもコマンドラインの知識が不要な、ユーザーフレンドリーな GUI ベースのインターフェースを提供し、RAD-seq データを処理できるようにすること。
  • Makeflow と Weaver を用いたスケーラブルで分散実行可能な RAD タグ解析を可能にすること。
  • アセンブラやアラインメントツールなどのコアコンポonent を代替可能にすることで、カスタマイズ可能なワークフローを提供すること。

提案手法

  • バーコード、切断部位、低品質な配列(例:過剰な N 残基を含むもの)を除去する Python ベースのトリマーを用い、可変長バーコードおよびペアエンド読み取りをサポートする。
  • ユーザーが定義した同一性閾値に基づいて、シーケンス同一性を計算し、読み取りをクラスタにグループ化するためのバンド付き Smith-Waterman アルゴリズムを採用する。
  • 各クラスタ内で最も代表的なコンセンサス配列(コンティグに相当)を特定するために、修正されたセンター・スター整合法を適用する。
  • 分散処理ノード間での重複または重複クラスタを解消するために、Smith-Waterman アラインメントを用いた段階的で分散型のマージ処理を実施する。
  • GUI またはコマンドラインシェルスクリプトによる実行をサポートし、Makeflow と Weaver を用いたクラウドやクラスタ環境への統合が可能である。
  • デフォルトのアセンブラを他のツールに置き換えることが可能で、分析パイプラインのモジュラーなカスタマイズを可能にする。

実験結果

リサーチクエスチョン

  • RQ1リファレンスゲノムが利用できない状況で、どのように RAD タグシーケンシングデータを効率的に処理できるか?
  • RQ2従来のアセンブラと比較して、分散処理可能で GUI を備えたパイプラインは、データ使用率を向上させ、メモリ消費量を削減できるか?
  • RQ3可変長バーコードおよび異種の読み取りデータは、RAD タグ解析においてどの程度効果的に処理できるか?
  • RQ4コンセンサス配列クラスタリングは、デノボアセンブリと比較して、メモリ効率とデータ利用効率の面で優れているか?
  • RQ5モジュラーなパイプライン設計は、パフォーマンスや使いやすさを損なわず、代替アセンブラやアラインメントツールの統合を可能にするか?

主な発見

  • Hot RAD は、他の RAD タグツールと比較してより多くの配列を処理し、読み取りをより少ない数、より深い遺伝子座にクラスタリングすることで、高いデータ使用率を達成している。
  • 「BP + Fast Align」フィルタを適用した結果、18,524 個の読み取りを処理し、3,108 個のクラスタを生成したが、実行時間は 773.1 分から 16.9 分にまで短縮された。
  • オaks や野外で捕獲されたハエ、マラリア蚊などの異種データセットにおいても、Hot RAD は Stacks や RADTools と比較して、特に顕著に多くの配列を処理している。
  • Hot RAD の分散アーキテクチャにより、Makeflow と Weaver を用いたクラスターやクラウド環境でもスケーラブルな実行が可能となり、大規模データセットの処理時間を顕著に短縮している。
  • シングルエンドおよびペアエンド読み取りを両方対応しているが、2 番目の読み取りは配置に使用していない。また、低カバレッジクラスタのオプション削除により処理を高速化できる。
  • Hot RAD のモジュラー設計により、SeqMan NGen などの他のツールにデフォルトアセンブラを置き換えることが可能であり、コアのクラスタリングおよびコンセンサス生成パイプラインとの互換性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。