Skip to main content
QUICK REVIEW

[論文レビュー] SMaSH: A Benchmarking Toolkit for Human Genome Variant Calling

Ameet Talwalkar, Jesse Liptrap|arXiv (Cornell University)|Oct 31, 2013
Genomics and Phylogenetic Studies参考文献 22被引用数 8
ひとこと要約

SMaSH は、人間ゲノムバリアントコールのための標準化されたベンチマークツールキットであり、合成データ、マウスデータ、および実際の人間ゲノムデータを統合して、正確性と計算パフォーマンスを評価する。既存のベンチマーク手法における一貫性の欠如を是正し、キュレート済みデータ、ノイズ対応メトリクス、再現可能性のある評価を提供する。SNPおよび構造的バリアントコールャーの性能に顕著なばらつきが、異なるデータセット間で生じることが明らかになった。

ABSTRACT

Motivation: Computational methods are essential to extract actionable information from raw sequencing data, and to thus fulfill the promise of next-generation sequencing technology. Unfortunately, computational tools developed to call variants from human sequencing data disagree on many of their predictions, and current methods to evaluate accuracy and computational performance are ad-hoc and incomplete. Agreement on benchmarking variant calling methods would stimulate development of genomic processing tools and facilitate communication among researchers. Results: We propose SMaSH, a benchmarking methodology for evaluating human genome variant calling algorithms. We generate synthetic datasets, organize and interpret a wide range of existing benchmarking data for real genomes, and propose a set of accuracy and computational performance metrics for evaluating variant calling methods on this benchmarking data. Moreover, we illustrate the utility of SMaSH to evaluate the performance of some leading single nucleotide polymorphism (SNP), indel, and structural variant calling algorithms. Availability: We provide free and open access online to the SMaSH toolkit, along with detailed documentation, at smash.cs.berkeley.edu.

研究の動機と目的

  • 人間ゲノムバリアントコールツールのための一貫性があり再現可能なベンチマーク基準の欠如を是正すること。
  • 実ゲノムと合成シミュレーションから得られる分散したベンチマークデータを、統合的かつアクセス可能なフレームワークに統合すること。
  • 不完全な真値(グランドトゥルース)を考慮したノイズ対応の正確性メトリクスを開発すること。
  • 正確性に加えて、実行時間、コスト、リソース使用量といった計算パフォーマンスメトリクスを統合し、包括的なツール評価を実現すること。
  • 標準化された評価プロトコルを用いて、異なるバリアントコールャー間で公正で再現可能な比較を可能にすること。

提案手法

  • SMaSH は、制御されたベンチマークとしての役割を果たす、既知のバリアントを含む合成ヒトゲノムデータセットを生成する。
  • NA12878、ベンター、NA18575 などのプロジェクトから得られた既存の実世界のベンチマークデータを統合・キュレートし、汚染済みおよび高カバレッジのサンプルを含む。
  • SangerシーケンシングおよびSNPチップにおける既知の誤り率を考慮したノイズ対応の正確性(精度・再現率)メトリクスを適用する。
  • 予測値とグランドトゥルースの両方のコールにおいてVCF形式の不一致を解消することで、バリアント表現の標準化を実施する。
  • 構造的バリアントに対しては、正確一致およびブレークポイント許容型マッチングを評価し、許容しきい値(例:長挿入に対して100bp)を設定する。
  • さまざまなハードウェア構成で、クロック時間、CPU時間、メモリ使用量、ディスク使用量、クラウドコスト見積もりを含めた計算パフォーマンスを追跡する。

実験結果

リサーチクエスチョン

  • RQ1多様な実際および合成ヒトゲノムデータセットにおける、主要なSNPおよび構造的バリアントコールャーの正確性(精度・再現率)はどの程度か?
  • RQ2グランドトゥルースデータのノイズ(例:Sangerシーケンシングの誤り)が正確性メトリクスに与える影響はどの程度で、ベンチマークでこれを是正できるか?
  • RQ3実行時間、メモリ使用量、クラウドコストといった計算パフォーマンスメトリクスは、異なるバリアントコールャーおよびデータセット間でどのように変動するか?
  • RQ4ツールとグランドトゥルースデータ間でバリアント表現がどの程度一貫しているか、そしてその影響が評価結果に与えるものとは何か?
  • RQ5統合的で一貫性のあるベンチマークフレームワークは、バリアントコールツール評価の再現性と比較可能性を向上させられるか?

主な発見

  • Pindel は、ベンター・データセットで100bpの許容範囲を用いた近似評価において、長挿入に対して71.7%の精度と71.7%の再現率を達成した。一方、BreakDancer は4.2%の精度と0.0%の再現率にとどまった。
  • 汚染済みベンター・データセットでは、Pindel は400時間以上を要し、1000ドル以上のクラウドコストがかかり、正しいコールは一切得られなかった。一方、BreakDancer は0.0%の精度と再現率を示した。
  • NA12878 データセットでは、Pindel は81時間、203ドルのコストを要し、再現率は0.0%であった。一方、BreakDancer は再現率0.0%で、わずか3時間の実行時間であった。
  • NA19240 データセットでは、BreakDancer は再現率0.0%、29時間の実行時間を要した。一方、Pindel は221時間、552ドルのコストを要し、正しいコールは得られなかった。
  • このツールキットにより、計算コストと実行時間が顕著に異なることが明らかになった。GATK は NA19240 で最大434時間のCPU時間と418ドルのクラウドコストを要したが、mpileup ははるかに少ない時間とコストで処理を完了した。
  • BreakDancer は、低メモリ使用量と低ディスク使用量を維持しており、データセット間で最も一貫性のあるパフォーマンスを示したが、実データでは再現率が低く、高い偽陰性率を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。