Skip to main content
QUICK REVIEW

[論文レビュー] Fast Inference of Admixture Coefficients Using Sparse Non-negative Matrix Factorization Algorithms

Éric Frichot, François Mathieu|arXiv (Cornell University)|Sep 24, 2013
Genetic Mapping and Diversity in Plants and Animals参考文献 29被引用数 3
ひとこと要約

この論文では、最小二乗最適化を用いたスパース非負値行列分解(NMF)を用いて、個々の混合係数を高速かつ高精度に推定するsNMFを提案する。ヒトおよび植物のゲノムデータセットを用いた検証では、R² > 0.96およびRMSE < 5.5%の高い精度を達成し、ADMIXTUREに比べ10–30倍の高速化を実現した。

ABSTRACT

Inference of individual admixture coefficients, which is important for population genetic and association studies, is commonly performed using compute-intensive likelihood algorithms. With the availability of large population genomic data sets, fast versions of likelihood algorithms have attracted considerable attention. Reducing the computational burden of estimation algorithms remains, however, a major challenge. Here, we present a fast and efficient method for estimating individual admixture coefficients based on sparse non-negative matrix factorization algorithms. We implemented our method in the computer program sNMF, and applied it to human and plant genomic data sets. The performances of sNMF were then compared to the likelihood algorithm implemented in the computer program ADMIXTURE. Without loss of accuracy, sNMF computed estimates of admixture coefficients within run-times approximately 10 to 30 times faster than those of ADMIXTURE.

研究の動機と目的

  • 大規模ゲノムデータから混合係数を推定する際の尤度ベース手法(例:ADMIXTURE)の計算的ボトル neck を解消すること。
  • 尤度ベースの集団構造推定法の高速でスケーラブルな代替手法を、高い精度を維持した上で開発すること。
  • 多様な集団遺伝学的データセットにおける系統係数推定に、非パラメトリックで頑健なスパースNMFの有効性を評価すること。
  • 実データおよびシミュレートされたヒトおよび植物ゲノムデータを用いて、sNMFの精度と実行時間をADMIXTUREと比較すること。
  • さまざまな混合度、近交度、欠損データレベル下での真の集団構造および系統割合の回復能力を、本手法の有効性を検証すること。

提案手法

  • 遺伝子型行列をスパースな混合割合行列Qと遺伝子プール頻度行列Gに分解するために、スパース非負値行列分解(NMF)を用いる。
  • QとGの最適化に、活性集合法を用いた正則化付き最小二乗最小化問題を解き、正則化によりスパarsityを強制する。
  • マスクされた遺伝子型に基づく交差エントロピー基準を用いて、最適なK(系統集団数)および正則化パラメータαを選択する。
  • SNPの5%をランダムにマスクして、アレル頻度予測精度を評価するためのテストセットを構築する。
  • 予測された遺伝子型確率を次の式で予測する:$ p^{ ext{pred}}_{i heta}(j) = \sum_{k=1}^{K} q_{ik} g_{k heta}(j) $、ここでjは遺伝子型(0,1,2)を表す。
  • 予測された分布と真のアレル分布の間の交差エントロピーを用いてモデル性能を評価し、$ H(p^{ ext{sample}}, p^{ ext{pred}}) = -\sum_{j=0}^{2} p^{ ext{sample}}(j) \log p^{ ext{pred}}_{i heta}(j) $ を最小化する。

実験結果

リサーチクエスチョン

  • RQ1スパースNMFは、ADMIXTUREのような尤度ベース手法の計算効率の良い代替手段として、混合係数推定に有効であるか?
  • RQ2sNMFは、多様なヒトおよび植物ゲノムデータセットにおいて、ADMIXTUREが推定した混合係数をどれほど正確に再現できるか?
  • RQ3シミュレートされたデータにおいて、混合度、近交度、欠損データのレベルが変化しても、sNMFはどれほど高い精度を維持できるか?
  • RQ4交差エントロピー基準は、実データおよびシミュレートされたデータにおいて、正しい系統集団数(K)および最適な正則化パラメータ(α)を信頼性を持って特定できるか?
  • RQ5さまざまなデータセットサイズおよびSNP数において、sNMFの実行時間はADMIXTUREと比べてどの程度高速か?

主な発見

  • 6つのHGDPパネルにおける480回の実行において、sNMFはADMIXTURE推定値と中央でR² > 0.96の相関を示し、混合係数の再現精度が非常に高いことを示した。
  • sNMF推定値の平均二乗誤差(RMSE)は、すべての480回の実行で5.5%未満に保たれ、一貫した精度を示した。
  • 1000 Genomesデータセットでは、sNMFはADMIXTUREに比べ約10~30倍の高速で混合係数を計算し、精度に劣りはなかった。
  • シミュレートされたデータにおいて、交差エントロピー基準は、中程度から高い近交度(F_IS = 25%および100%)下でも、正しいKおよび最適なαを的確に同定した。
  • マスクされた遺伝子型においても、sNMFは高い予測精度を維持し、交差エントロピー値からアレル頻度の推定が信頼できることが示された。
  • 本手法は、ヒト(HGDP、1000 Genomes)および植物(A. thaliana)の両方のデータで、低混合度の集団構造を正確に同定するという点で、頑健に機能した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。