Skip to main content
QUICK REVIEW

[論文レビュー] A Bayesian test to identify variance effects

Bianca Dumitrascu, Gregory Darnell|arXiv (Cornell University)|Dec 5, 2015
Genetic Mapping and Diversity in Plants and Animals参考文献 42被引用数 5
ひとこと要約

本論文は、ベイジアン不均等分散線形回帰を用いて、遺伝的変異が表現型の分散に影響を与える(vQTLs)かどうかを検出するための新規手法であるベイジアン不均等分散性検定(BTH)を提案する。BTHは、平均効果と分散効果を同時にモデル化し、完全な不確実性の評価を実施することで、過剰適合を低減し、連続的および離散的共変数における分散効果の柔軟な検出を可能にする。従来の検定手法に比べ、優れた性能を発揮する。

ABSTRACT

Identifying genetic variants that regulate quantitative traits, or QTLs, is the primary focus of the field of statistical genetics. Most current methods are limited to identifying mean effects, or associations between genotype and the mean value of a quantitative trait. It is possible, however, that a genetic variant may affect the variance of the quantitative trait in lieu of, or in addition to, affecting the trait mean. Here, we develop a general methodological approach to identifying covariates with variance effects on a quantitative trait using a Bayesian heteroskedastic linear regression model. We show that our Bayesian test for heteroskedasticity (BTH) outperforms classical tests for differences in variation across a large range of simulations drawn from scenarios common to the analysis of quantitative traits. We apply BTH to methylation QTL study data and expression QTL study data to identify variance QTLs. When compared with three tests for heteroskedasticity used in genomics, we illustrate the benefits of using our approach, including avoiding overfitting by incorporating uncertainty and flexibly identifying heteroskedastic effects.

研究の動機と目的

  • 従来の手法が、単に平均効果にのみ注目するのに対し、表現型の分散に影響を与える遺伝的変異(vQTLs)を検出する能力に限界があることに対処すること。
  • ゲノム分野で一般的に用いられる古典的不均等分散性検定の欠点(連続的共変数を扱えないこと、不確実性の評価が不十分であること、過剰適合が生じること)を克服すること。
  • 共変数による交絡要因を考慮しつつ、平均効果と分散効果を同時にモデル化する、堅牢で柔軟かつスケーラブルなベイジアンフレームワークを構築すること。
  • 多様なシミュレーション状況および実世界のゲノムデータセットを用いてBTHを検証し、統計的パワーと信頼性の向上を示すこと。
  • 遺伝子発現およびメチル化データにおけるvQTLの全ゲノムスケール同定を可能にし、表現型変動の遺伝的制御の理解を深めること。

提案手法

  • 定量的表現型の平均および分散が共変数(例:遺伝子型)に依存するベイジアン不均等分散線形回帰モデルを定式化し、分散は指数関数的線形予測子の関数としてモデル化する:$\sigma^2 \alpha^{-x_i}$。
  • 弱情報的事前分布を設定:平均効果$\beta$には正規事前分布、残差分散$\sigma^2$には逆ガンマ分布、$\log(\alpha)$にはコーシー事前分布を適用し、分散効果の柔軟な検出を可能にする。
  • ラプラス近似を用いて、分散効果の存在を検出するベイズ因子を効率的に計算し、全ゲノムスケールでのスクリーニングを可能にする。
  • 年齢、性別、集団構造などの交絡共変数を、平均モデルおよび分散モデルの両方で線形補正により組み込むことで、モデルの頑健性を向上させる。
  • シミュレーションデータを用いてトレーニングしたランダムフォレスト分類器を用い、モデルの適合度を評価し、仮定された不均等分散モデルからの逸脱を検出する。
  • 実データに適用するための前処理パイプラインを適用:対数変換、集団構造およびバッチ効果のための主成分分析による補正、およびvQTL検定の前の残差標準化。

実験結果

リサーチクエスチョン

  • RQ1多様なシミュレーション状況において、古典的検定(Levene、Brown-Forsythe、CLS)に比べ、ベイジアンフレームワークが分散を制御する遺伝的変異(vQTLs)を検出する能力に優れているか?
  • RQ2データに交絡共変数(例:集団構造、年齢)が存在する場合、BTHはvQTLをどの程度効果的に検出できるか?
  • RQ3パrameter推定における不確実性を組み込むことで、CLSなどの古典的手法と比較して過剰適合がどの程度低減されるか?
  • RQ4既存の手法と比較して、BTHは実世界の遺伝子発現およびメチル化データにおけるvQTLの同定にどの程度有効であるか?
  • RQ5古典的パラメトリック検定が見逃す可能性のある非単調的または複雑な分散効果を、BTHは検出できるか?

主な発見

  • BTHは、連続的共変数および交絡要因が存在する状況を含め、広範なシミュレーション状況において、古典的検定(Levene、Brown-Forsythe、CLS)を著しく上回る性能を示す。
  • 特に真の分散効果が非単調的である場合、または潜在的な交絡要因が存在する場合、CLSよりもBTHが分散効果の検出に高い統計的パワーを発揮する。
  • ベイジアン推論により平均効果および分散効果の推定値における不確実性を完全に組み込むことで、型Iエラー率を適切に制御し、過剰適合を低減する。
  • 実データ応用において、BTHはCAP研究の遺伝子発現データおよびHapMapメチル化データの両方で、従来の検定手法が見逃した多数の新規vQTLを同定した。
  • シミュレーションデータを用いてトレーニングしたランダムフォレスト分類器は、BTHモデルの適合度が真のデータ生成プロセスと一致することを確認し、代替モデル(例:指数的平均、対数正規分布)と明確に区別できた。
  • 集団構造およびバッチ効果が存在する状況においても、BTHは分散効果の検出において優れた性能を示し、複雑な交絡構造を有する実世界のゲノム研究における有用性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。