[論文レビュー] Analysis of Extremely Obese Individuals Using Deep Learning Stacked Autoencoders and Genome-Wide Genetic Data
本研究では、従来のGWASの限界を克服し、非線形なSNP-SNP相互作用を捉えるためにスタックドオートエンコーダー(SAE)を用いた深層学習手法を提案する。極度の肥満に罹患する個体のゲノムワイドな遺伝データを分析した結果、AUCが0.975、ジニスコアが0.950に達し、線形GWASモデルを著しく上回る分類性能を示した。
The aetiology of polygenic obesity is multifactorial, which indicates that life-style and environmental factors may influence multiples genes to aggravate this disorder. Several low-risk single nucleotide polymorphisms (SNPs) have been associated with BMI. However, identified loci only explain a small proportion of the variation ob-served for this phenotype. The linear nature of genome wide association studies (GWAS) used to identify associations between genetic variants and the phenotype have had limited success in explaining the heritability variation of BMI and shown low predictive capacity in classification studies. GWAS ignores the epistatic interactions that less significant variants have on the phenotypic outcome. In this paper we utilise a novel deep learning-based methodology to reduce the high dimensional space in GWAS and find epistatic interactions between SNPs for classification purposes. SNPs were filtered based on the effects associations have with BMI. Since Bonferroni adjustment for multiple testing is highly conservative, an important proportion of SNPs involved in SNP-SNP interactions are ignored. Therefore, only SNPs with p-values < 1x10-2 were considered for subsequent epistasis analysis using stacked auto encoders (SAE). This allows the nonlinearity present in SNP-SNP interactions to be discovered through progressively smaller hidden layer units and to initialise a multi-layer feedforward artificial neural network (ANN) classifier. The classifier is fine-tuned to classify extremely obese and non-obese individuals. The best results were obtained with 2000 compressed units (SE=0.949153, SP=0.933014, Gini=0.949936, Lo-gloss=0.1956, AUC=0.97497 and MSE=0.054057). Using 50 compressed units it was possible to achieve (SE=0.785311, SP=0.799043, Gini=0.703566, Logloss=0.476864, AUC=0.85178 and MSE=0.156315).
研究の動機と目的
- 従来のGWASがBMIの遺伝性を説明するのには限界があることと、極度の肥満を分類するのにも予測力が低いことに対処すること。
- 保守的な多重検定補正により見逃されがちな、非線形なエピスタシス相互作用(SNP間相互作用)を同定すること。
- 分類性能の向上を図るために、高次元の遺伝データをスタックドオートエンコーダーを用いて圧縮すること。
- 肥満分類を目的とした、多層フィードフォワードニューラルネットワークの初期化とファインチューニングを実行する深層学習パイプラインの開発。
- SNPのp値 < 1×10⁻² にフィルタリングしたデータセットを用いて、AUC、ジニ、対数損失などの標準指標を用いてモデルの性能を評価すること。
提案手法
- 次元削減のため、p値 < 1×10⁻² にフィルタリングすることで、関連する可能性のあるバリアントを保持しつつ、次元を削減した。
- スタックドオートエンコーダー(SAE)を用い、逐次的な符号化・復元層を経て、SNPデータの階層的で非線形な表現を学習した。
- SAEの圧縮表現(2000ユニットおよび50ユニット)を、多層フィードフォワードアーティフィシャルニューラルネットワーク(ANN)分類器の入力として使用した。
- バックプロパゲーションを用いて、極度の肥満と非肥満の個体を分類するためのANN分類器をファインチューニングした。
- 2段階のプロセスを採用:まずSAEによる事前学習で重みを初期化し、その後、エンドツーエンドのファインチューニングで性能を向上させた。
- 標準指標(AUC、ジニ、感度(SE)、特異度(SP)、対数損失、平均二乗誤差(MSE))を用いてモデルの性能を評価した。
実験結果
リサーチクエスチョン
- RQ1スタックドオートエンコーダーを用いた深層学習ベースの次元削減は、従来のGWASを上回る極度の肥満の分類性能を向上させることができるか?
- RQ2非線形なSNP-SNP相互作用は、極度の肥満に罹患する個体のBMIの遺伝性にどの程度寄与しているか?
- RQ3p値の閾値をより緩いもの(p < 1×10⁻²)に設定することで、エピスタシス相互作用の検出にどのような影響が生じるか?
- RQ4極度の肥満予測の分類精度を最大化するための、SAEにおける最適な圧縮表現サイズ(ユニット数)は何か?
- RQ5SAEベースのモデルと標準的なGWAS手法との間で、AUC、ジニ、対数損失といった性能指標はどのように比較されるか?
主な発見
- 2000ユニットの圧縮表現を用いたモデルは、AUCが0.97497に達し、極度の肥満と非肥満の個体を優れた性能で識別した。
- 同じモデルはジニスコア0.949936に達し、予測順位付けの性能が優れていることを示した。
- 感度(SE)は0.949153、特異度(SP)は0.933014であり、真陽性率と真陰性率の両方が高いことを示した。
- 対数損失は0.1956に最小化され、予測確率の信頼性と正確性が高かった。
- 50ユニットの圧縮表現でも、AUCが0.85178、ジニが0.703566に達し、低次元でも高いロバストネスを示した。
- 2000ユニットモデルの平均二乗誤差(MSE)は0.054057であり、予測誤差が低かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。