[論文レビュー] Modeling population structure under hierarchical Dirichlet processes
本稿では、遺伝子座間の連鎖多様性(LD)を考慮した、階層的ディリクレ過程(HDP)に基づくベイジアン非パラメトリックモデルを提案する。隣接する遺伝子マーカー間の相関する系統的由来をモデル化することで、従来のSTRUCTUREのような手法に比べ、変動する系統的領域長と、系統的由来集団数の非パラメトリック推定を可能にし、実データにおける希少なハプロタイプの正確な同定を示している。
We propose a Bayesian nonparametric model to infer population admixture, extending the Hierarchical Dirichlet Process to allow for correlation between loci due to Linkage Disequilibrium. Given multilocus genotype data from a sample of individuals, the model allows inferring classifying individuals as unadmixed or admixed, inferring the number of subpopulations ancestral to an admixed population and the population of origin of chromosomal regions. Our model does not assume any specific mutation process and can be applied to most of the commonly used genetic markers. We present a MCMC algorithm to perform posterior inference from the model and discuss methods to summarise the MCMC output for the analysis of population admixture. We demonstrate the performance of the proposed model in simulations and in a real application, using genetic data from the EDAR gene, which is considered to be ancestry-informative due to well-known variations in allele frequency as well as phenotypic effects across ancestry. The structure analysis of this dataset leads to the identification of a rare haplotype in Europeans.
研究の動機と目的
- 近接する遺伝子座間の連鎖多様性(LD)を適切に扱えない既存の系統的由来モデルの限界を是正すること。
- 事前に固定されたKを仮定せずに、系統的由来集団数を非パラメトリックに推定する手法を開発すること。
- 系統的由来ゲノムのモザイク的性質を反映して、染色体セグメントを系統的由来集団に正確に割り当てること。
- 特定の突然変異プロセスを仮定しないで集団構造をモデル化することにより、多様な遺伝子マーカーに適用可能になること。
- 系統的由来解析のための完全なベイジアンフレームワークを提供すること。MCMC推定と事後分布の要約ツールを含む。
提案手法
- 連鎖多様性を捕らえるために、遺伝子座間の相関する系統的由来状態をモデル化するため、階層的ディリクレ過程(HDP)を拡張し、集団割り当てを中国レストラン過程(CRP)の表現で記述する。
- 集団所属(z_il)、系統的由来割合(n_ik, m_ik)、アレルル頻度(θ_kl)、ハイパーパrameter(α, α₀, r, μ_l)の条件付き更新を用いたギブスサンプラーを用いる。
- SNPデータに対してベータ=二項分布の共役構造を採用し、各集団における観察されたゲノタイプに条件づけてθ_klがベータ分布に従うようにする。
- 濃度パラメータαとα₀の効率的事後更新のため、補助変数とポリア・ガンマのデータ補完を用いる。
- ポisson過程のレートrおよびベース測度Hのハイパーパrameterμ_lの更新に、ランダムウォークメトロポリスステップを適用する。
- ベース測度Hに非パラメトリックな事前分布を導入し、固定されたパラメトリック形を仮定せずに、系統的アレルル頻度を柔軟にモデル化可能にする。
実験結果
リサーチクエスチョン
- RQ1遺伝子座が連鎖多様性のために相関している場合、どのようにして系統的由来をモデル化できるか?
- RQ2ベイジアン非パラメトリックモデルは、事前にKを指定せずに系統的由来集団数を推定できるか?
- RQ3LDを考慮することで、染色体領域の系統的由来推定の正確さはどの程度向上するか?
- RQ4系統的由来モデルにおける複雑で高次元の事後分布を効率的に探索するためのMCMCサンプリングは、どのように設計できるか?
- RQ5このモデルを用いることで、EDARハプロタイプのような希少な遺伝子変異について、どのような知見が得られるか?
主な発見
- 本モデルは、従来の標準的手法が見過ごしていた、ヨーロッパ系集団内におけるEDAR遺伝子内の希少ハプロタイプを正確に同定した。
- 系統的由来集団数に対する事後推定は非パラメトリックに決定され、モデルがデータ駆動のクラスタ数に自動的に適合することが示された。
- LDモデルの組み込みにより、系統的由来セグメント長および染色体領域の由来集団の推定がより正確になった。
- シミュレーションでは、LD条件下で本モデルが標準的HDPおよびSTRUCTUREを上回り、真の集団構造をよりよく回復した。
- MCMCアルゴリズムは良好に収束し、系統的由来割合および集団所属の信頼性の高い事後分布要約を提供した。
- 本手法はさまざまな遺伝子マーカーに対して頑健であり、背後にある突然変異プロセスに関する仮定を必要としなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。