Skip to main content
QUICK REVIEW

[論文レビュー] Estimating and accounting for unobserved covariates in high dimensional correlated data

Chris McKennan, Dan L. Nicolae|arXiv (Cornell University)|Aug 17, 2018
Statistical Methods and Inference参考文献 30被引用数 3
ひとこと要約

本稿では、縦断的またはマルチティッシュ‘オミクス’データなど、非i.i.d.な残差を示す高次元の相関データにおいて、標準的手法が失敗する状況下で、潜在的な交絡要因の数と構造を計算的に効率よく推定するCBCVおよびCorrConfを提案する。これらの手法は、潜在的要因の推定と補正を、証明可能な正確性を伴って実現し、既知の共変量に関する下流の推論を改善する。

ABSTRACT

Many high dimensional and high-throughput biological datasets have complex sample correlation structures, which include longitudinal and multiple tissue data, as well as data with multiple treatment conditions or related individuals. These data, as well as nearly all high-throughput `omic' data, are influenced by technical and biological factors unknown to the researcher, which, if unaccounted for, can severely obfuscate estimation and inference on effects due to the known covariate of interest. We therefore developed CBCV and CorrConf: provably accurate and computationally efficient methods to choose the number of and estimate latent confounding factors present in high dimensional data with correlated or nonexchangeable residuals. We demonstrate each method's superior performance compared to other state of the art methods by analyzing simulated multi-tissue gene expression data and identifying sex-associated DNA methylation sites in a real, longitudinal twin study. As far as we are aware, these are the first methods to estimate the number of and correct for latent confounding factors in data with correlated or nonexchangeable residuals. An R-package is available for download at https://github.com/chrismckennan/CorrConf.

研究の動機と目的

  • 縦断的、マルチティッシュ、または関連する個体を含む複雑な相関構造を示す高次元生物学的データにおける未観測の交絡要因の課題に対処すること。
  • 残差が相関的または非交換可能である状況下で、既存の手法が失敗する中で、潜在的交絡要因の数と構造を正確に推定する手法を開発すること。
  • 独立同一分布に従わない残差を仮定せず、潜在的要因を補正することで、関心のある既知の共変量に関する正確な下流の推論を可能にすること。
  • 不均一な残差分散と構造的相関を示すデータ(繰り返し測定やバッチ効果に起因するものなど)に対して、証明可能な正確性と計算効率性を備えたソリューションを提供すること。

提案手法

  • 相関した残差を示す高次元データにおいて、潜在的要因の数とその構造を同時に推定するための新規手法CBCV(クロスバリデーションベースの基準)およびCorrConf(相関-交絡)を提案。
  • グループ固有および時刻固有の成分を含む、構造化された分散-共分散行列を用いる尤度ベースのフレームワークを採用し、非i.i.d.な残差構造を適切に扱う。
  • 2段階推定を実装:まず、相関構造に敏感なペナルティ付き尤度基準により潜在的要因の数を推定し、次に補正付き一般化最小二乗法を用いて因子負荷を推定。
  • 観測済みおよび未観測の共変量の効果を分離するための射影ベース推定量を採用し、潜在的要因が未観測であっても、関心のある回帰係数の一致推定を保証。
  • 標本サイズと次元の両方が増大する二重漸近的枠組みの下で、推定係数の漸近正規性を導出。理論的妥当性を確立。
  • 潜在的要因空間に対して回転不変推定量を用い、高次元設定における過剰適合を回避するため、残差分散推定量に縮小補正を適用。

実験結果

リサーチクエスチョン

  • RQ1相関的または非交換可能な残差を示す高次元データにおいて、潜在的交絡要因の数を正確に推定する方法は何か?
  • RQ2残差の相関を無視した場合、標準的手法による潜在的要因推定にどのような影響が生じ、既知の共変量に関する下流の推論にどのような影響を与えるか?
  • RQ3縦断的またはマルチティッシュデータのような複雑な相関構造を示すデータにおいて、潜在的要因の数と構造を同時に推定できる手法を開発できるか?
  • RQ4潜在的要因を補正することで、高スループット‘オミクス’データにおける真の生物学的効果の検出力と正確性はどの程度向上するか?

主な発見

  • CBCVおよびCorrConfは、シミュレートされたマルチティッシュ遺伝子発現データにおいて、既存の最先端手法を上回る性能で潜在的要因の数を推定し、交絡要因を補正する。
  • 8×10⁵個のCpG部位を含む実際の縦断的双子研究において、これらの手法は、他の手法よりも高い正確性で性別関連DNAメチル化部位を同定した。
  • 相関的または非交換可能な残差を示すデータにおいて、潜在的要因の推定を証明可能な正確性で行えるのは、本手法が最初である。これは、現在の統計的手法における重要な空白である。
  • 理論的解析により、関心のある回帰係数の推定量が、未観測の交絡要因を考慮した分散-共分散構造を有する漸近正規分布に従うことが示され、妥当な推論が保証される。
  • 標準的手法(平行分析やバイクロスバリデーションなど)が相関したデータにおいて潜在的要因の数を過剰に推定するという一般的な落とし穴を回避する。
  • Rパッケージ「CorrConf」はhttps://github.com/chrismckennan/CorrConfにて公開されており、実世界の研究への広範な再現性と応用を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。