[論文レビュー] Interpreting artificial neural networks to detect genome-wide association signals for complex traits
本研究では、複雑な形質における全ゲノム関連信号を検出するための、深層ニューラルネットワーク(DNNs)を解釈する一般化されたフレームワークを提案する。後処理解釈手法を用いて、関連するとみられる遺伝子座(PALs)を同定する。エストニア・バイオバンク統合症候群コhortに適用した結果、高い精度でPALsを同定した。新規に報告されていなかった遺伝子座を含むものであり、DNNsが従来の線形GWASモデルの代替として実用的かつ解釈可能な手法であることを示している。
Investigating the genetic architecture of complex diseases is challenging due to the multifactorial and interactive landscape of genomic and environmental influences. Although genome-wide association studies (GWAS) have identified thousands of variants for multiple complex traits, conventional statistical approaches can be limited by simplified assumptions such as linearity and lack of epistasis in models. In this work, we trained artificial neural networks to predict complex traits using both simulated and real genotype-phenotype datasets. We extracted feature importance scores via different post hoc interpretability methods to identify potentially associated loci (PAL) for the target phenotype and devised an approach for obtaining p-values for the detected PAL. Simulations with various parameters demonstrated that associated loci can be detected with good precision using strict selection criteria. By applying our approach to the schizophrenia cohort in the Estonian Biobank, we detected multiple loci associated with this highly polygenic and heritable disorder. There was significant concordance between PAL and loci previously associated with schizophrenia and bipolar disorder, with enrichment analyses of genes within the identified PAL predominantly highlighting terms related to brain morphology and function. With advancements in model optimization and uncertainty quantification, artificial neural networks have the potential to enhance the identification of genomic loci associated with complex diseases, offering a more comprehensive approach for GWAS and serving as initial screening tools for subsequent functional studies.
研究の動機と目的
- 複雑な形質のGWAS文脈において、深層ニューラルネットワークを解釈する一般化された、モデルに依存しないフレームワークの開発。
- 多様なシミュレーション条件下での因果関連遺伝子座の検出性能を、さまざまな後処理解釈手法とロジスティック回帰と比較すること。
- 具体的にはエストニア・バイオバンク統合症候群コhortの実世界データにフレームワークを適用し、新規に関連するとみられる遺伝子座(PALs)を同定すること。
- DNNに解釈ツールを組み合わせた手法が、従来の線形GWASモデルの代替または補完として有効であるかを評価すること。
- 正則化や確率的要因が、エピスタシスやドミナント効果などの非線形遺伝的効果を検出する際の信頼性と正確性に与える影響を評価すること。
提案手法
- 確率的要因を管理するため、重み付きドロップアウトと複数のランダムシードを用いて、シミュレート済みおよび実際の遺伝子型-フェノタイプデータセット上でDNNを訓練し、複雑な形質を予測する。
- 個々のSNPの特徴重要度スコアを抽出するために、LIME、SHAP、統合勾配といった複数の後処理解釈手法を適用する。
- 厳密な選択基準を用いて、関連するとみられる遺伝子座(PALs)を定義し、重要度スコアと統計的閾値に基づいてフィルタリングを行う。
- 遺伝子領域や脳形態関連経路に焦点を当て、PALsのエンリッチメント解析を実施し、生物学的関連性を評価する。
- 加法的、エピスタシス的、ドミナント・レシスティブ効果を含む多様な遺伝的構造を想定したシミュレーションを用いて、PAL検出性能を各手法間で比較する。
- エストニア・バイオバンク(EstBB)の実世界データを用いて結果を検証し、関係性のpi-hat < 0.2および290,522個の二アレルルスノイドに絞り込んだ厳密な品質管理を実施した。

実験結果
リサーチクエスチョン
- RQ1後処理解釈手法を用いたDNNは、線形モデルに比べて、非線形な遺伝的効果(例:エピスタシス、ドミナント効果)を複雑な形質においてより効果的に検出できるか?
- RQ2さまざまなシミュレーションパラメータ下で、SHAP、LIME、統合勾配といった異なる解釈手法は、真陽性遺伝子座の同定においてどのように比較されるか?
- RQ3DNNベースのPAL検出法は、エストニア・バイオバンク統合症候群コhortのような実世界のバイオバンクデータにおいて、既知または新規の遺伝子座をどの程度回復できるか?
- RQ4正則化や確率的要因は、高次元で多遺伝子的なデータにおいて、PAL検出の信頼性と正確性にどのように影響を与えるか?
- RQ5DNNによって同定されたPALsは、統合症候群における脳形態など、疾患関連の経路に有意にエンリッチされているか?
主な発見
- 複雑な遺伝的構造を有するシミュレーションにおいて、厳密な選択基準のもとでDNNベースの手法は高い正確性で関連遺伝子座を同定した。
- ロジスティック回帰と同等のROC AUCを示したが、わずかにロジスティック回帰より良い結果を示した。しかし、DNNはロジスティック回帰が検出できなかった独自の遺伝子座を同定した。これは非線形効果に敏感である可能性を示唆している。
- すべての解釈手法が主に相互作用的(エピスタシス的)効果を持つ遺伝子座を検出していたが、DNNはロジスティック回帰に比べ、ドミナントまたはレシスティブ効果を持つ遺伝子座をより多く同定した。
- 遺伝子領域におけるPALsのエンリッチメント解析では、主に脳形態関連の用語と関連していた。これは統合症候群コhortにおいて生物学的関連性があることを支持する。
- 本手法は、文献に以前に報告されていなかった新規のPALsを効果的に同定した。これは、従来のGWASをはるかに超える発見の可能性を示している。
- 重み付きドロップアウトと複数のランダムシードを用いたアンサンブル的トレーニングにより、誤検出を低減し、モデルの確率的要因にもかかわらず、高い耐性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。