Skip to main content
QUICK REVIEW

[論文レビュー] A unifying framework for the modelling and analysis of STR DNA samples arising in forensic casework

Robert G. Cowell|arXiv (Cornell University)|Feb 27, 2018
Forensic and Genetic Research参考文献 30被引用数 5
ひとこと要約

この論文は、確率母関数(PGF)と高速フーリエ変換(FFT)に基づく数値的手法を用いて、法医学的STR DNAサンプルのモデリングと解析のための統一的確率的フレームワークを提案する。PCR増幅を離散的多型分枝過程としてモデル化することで、高・低テンプレートDNAサンプルの両方において、スターターおよびノイズを含むアンプリコン分布の正確で効率的な計算が可能となり、公開データセットからのシミュレート済みおよび実データにおいて妥当性が検証された。

ABSTRACT

This paper presents a new framework for analysing forensic DNA samples using probabilistic genotyping. Specifically it presents a mathematical framework for specifying and combining the steps in producing forensic casework electropherograms of short tandem repeat loci from DNA samples. It is applicable to both high and low template DNA samples, that is, samples containing either high or low amounts DNA. A specific model is developed within the framework, by way of particular modelling assumptions and approximations, and its interpretive power presented on examples using simulated data and data from a publicly available dataset. The framework relies heavily on the use of univariate and multivariate probability generating functions. It is shown that these provide a succinct and elegant mathematical scaffolding to model the key steps in the process. A significant development in this paper is that of new numerical methods for accurately and efficiently evaluating the probability distribution of amplicons arising from the polymerase chain reaction process, which is modelled as a discrete multi-type branching process. Source code in the scripting languages Python, R and Julia is provided for illustration of these methods. These new developments will be of general interest to persons working outside the province of forensic DNA interpretation that this paper focuses on.

研究の動機と目的

  • 法医学的事案におけるDNAサンプルから電気泳動プロファイル(EPG)への全過程を数学的に厳密かつ統一的なフレームワークでモデリングすること。
  • ドロップイン、ドロップアウト、分解、スターター断片などの課題を解消し、低テンプレートDNA(LTDNA)サンプルの解釈を支援すること。
  • 特に複雑なPCRダイナミクス下でも、STRプロファイルにおけるアンプリコンピークの全確率分布を計算する汎用的な計算手法を提供すること。
  • 一貫した確率的モデルを用いて、混合サンプルの解釈における正確な尤度評価を可能にすること。
  • 単一で整合的な数学的定式化により、高・低テンプレートDNAサンプルの両方へ確率的ゲノタイピングの適用範囲を拡張すること。

提案手法

  • PCR増幅を離散的多型分枝過程としてモデル化し、標的およびスターターのアンプリコン生成の確率的ダイナミクスを単変量および多変量確率母関数(PGF)を用いて表現する。
  • 直接列挙が計算的に非現実的であるのを回避するため、高速フーリエ変換(FFT)を用いて標的およびスターターのアンプリコンの全確率分布を効率的に計算する。
  • 初期DNAテンプレート、増幅効率(p)、確率的サンプリング(phi)、ベースラインノイズ、および二項スプライシングによるドロップイン事象を含む、法医学的要因をモデルに統合する。
  • アンプリコンの起源とスターターのパターンを追跡するためのゲノムストランドモデルを導入し、モーメントおよび全分布のPGFに基づく定式化を提供する。
  • 複数の被験者、レプリカ、およびタイプ未定義被験者の同時モデリングを可能とし、ピーク高さ相関の補正にも対応する拡張も含む。
  • Python、R、Juliaでの数値実装が提供され、FFTに基づくアルゴリズムにより、周辺分布および同時分布を効率的に計算可能である。

実験結果

リサーチクエスチョン

  • RQ1法医学的STR解析におけるDNAサンプルから電気泳動プロファイル(EPG)への全遷移を、単一で数学的に整合性のあるフレームワークでモデル化する方法は何か?
  • RQ2さまざまなテンプレート量において、スターターおよびノイズを含むPCRアンプリコンの全確率分布を、最も効率的かつ正確に計算する方法は何か?
  • RQ3混合サンプルの解釈において、標的ピークとスターターピーク高さの相関構造をどのようにモデリングし、補正できるか?
  • RQ4このフレームワークは、シミュレート済みおよび実際の低テンプレートDNA混合サンプルの観察されたEPGパターンをどの程度正確に再現できるか?
  • RQ5確率母関数とFFTの使用により、シミュレーションに依存せずに、スケーラブルかつ高精度な複雑な法医学的尤度の計算が可能になるか?

主な発見

  • 同一の確率的定式化を用いて高・低テンプレートDNAサンプルを成功裏にモデリングし、シミュレート済みデータにおいて妥当性が検証された。
  • FFTに基づく計算により、大規模なPCRサイクル数(例:K=28)に対しても、切り捨てによるメモリおよび時間の最適化を伴い、正確で効率的なアンプリコン分布の評価が可能となった。
  • モデルはスターターパターン(特に1ステップ後退スターター)を正確に捉え、高い精度で周辺分布および同時分布の計算が可能となった。
  • ドロップインおよびベースラインノイズの組み込みにより、PROVEDitデータセットの2人および3人混合サンプルにおいて、実データのモデルキャリブレーションが向上した。
  • 変更されたFFTモデルにより、混合サンプルにおけるピーク高さ相関の補正が成功裏に実施され、複雑なケースにおける尤度推定の精度が向上した。
  • Python、R、Juliaで提供されたソースコードは、分布の生成および可視化に有効であることが示され、K=28サイクルおよび大規模Nにおける性能が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。