Skip to main content
QUICK REVIEW

[論文レビュー] Joint Mean and Covariance Estimation with Unreplicated Matrix-Variate Data

Michael Hornstein, Roger Fan|arXiv (Cornell University)|Nov 13, 2016
Statistical Methods and Inference参考文献 31被引用数 4
ひとこと要約

本論文は、一般化最小二乗法と罰則付き共分散推定を用いて、反復のない行列変数データにおける平均構造と共分散構造の共同推定手法を提案する。本手法は、平均パラメータおよび依存構造の一貫した推定を達成し、がんゲノム解析における差分発現解析のキャリブレーションと検出力の向上を実現する。

ABSTRACT

It has been proposed that complex populations, such as those that arise in genomics studies, may exhibit dependencies among observations as well as among variables. This gives rise to the challenging problem of analyzing unreplicated high-dimensional data with unknown mean and dependence structures. Matrix-variate approaches that impose various forms of (inverse) covariance sparsity allow flexible dependence structures to be estimated, but cannot directly be applied when the mean and covariance matrices are estimated jointly. We present a practical method utilizing generalized least squares and penalized (inverse) covariance estimation to address this challenge. We establish consistency and obtain rates of convergence for estimating the mean parameters and covariance matrices. The advantages of our approaches are: (i) dependence graphs and covariance structures can be estimated in the presence of unknown mean structure, (ii) the mean structure becomes more efficiently estimated when accounting for the dependence structure among observations; and (iii) inferences about the mean parameters become correctly calibrated. We use simulation studies and analysis of genomic data from a twin study of ulcerative colitis to illustrate the statistical convergence and the performance of our methods in practical settings. Several lines of evidence show that the test statistics for differential gene expression produced by our methods are correctly calibrated and improve power over conventional methods. Supplementary materials for this article are available online.

研究の動機と目的

  • 観測値と変数に複雑な依存関係が存在する高次元で反復のない行列変数データにおいて、平均構造と共分散構造を推定する課題に対処すること。
  • 反復が存在しない状況で平均と共分散を同時に推定できない既存手法の制限を克服すること。
  • 予期しないサンプルワイドな相関を考慮することで、差分遺伝子発現解析の統計的仮説検定のキャリブレーションと検出力を向上させること。
  • 一般化最小二乗法としきい値処理を交互に用いることで、平均と共分散の推定を繰り返し行う実用的な反復アルゴリズムを開発すること。
  • 依存構造を考慮することで、よりキャリブレーションの良い検定統計量が得られ、後処理の調整(例:ゲノムコントロール)の必要性が低減されることを示すこと。

提案手法

  • 未知の共分散構造を考慮しながら、一般化最小二乗法(GLS)を用いて平均パラメータを推定する。
  • スパarsityを実現するためのしきい値処理を用いて、観測値および変数の両方の依存関係を同時にモデル化する罰則付き(逆)共分散推定を適用する。
  • 作業共分散行列のもとでの平均推定と、残差を用いた共分散推定の更新を交互に繰り返す。
  • 平均と共分散の共同推定後に、Wald型統計量を用いて平均パラメータの推論を行う。
  • Zhouら(2014)が提唱した二方向共分散推定手法を基盤とし、行列の両軸に沿った依存関係をモデル化する。
  • サンプルワイド共分散に含まれる完全な依存構造 $A$ を考慮する修正版サーピング手順を実装し、検定統計量のキャリブレーションを向上させる。

実験結果

リサーチクエスチョン

  • RQ1未知の依存構造を有する反復のない行列変数データにおいて、平均と共分散の共同推定を一貫して達成できるか?
  • RQ2サンプルワイド相関を考慮することで、差分発現解析における検定統計量のキャリブレーションはどのように向上するか?
  • RQ3観測値および変数の両方の依存関係をモデル化することは、統計的検出力および誤発見率制御にどのような影響を与えるか?
  • RQ4本手法が、サーピングや混同要因補正といった既存手法と比較して、感度および特異度の観点でどのように差をつけるか?
  • RQ5高次元のがんゲノム研究において、ゲノムコントロールのような後処理のキャリブレーション調整の必要性がどの程度低減されるか?

主な発見

  • 適切な正則化条件下で、本手法は平均パラメータおよび共分散行列の両方について一貫した推定を達成する。
  • シミュレーション研究では、本手法が、真の平均差を検出する感度および特異度の観点で、サーピングおよび混同要因補正手法を一貫して上回ることが示された。
  • 非単位共分散構造(例:AR1やブロック構造)を有する設定では、従来のアプローチと比較して、本手法が検定統計量のキャリブレーションを顕著に改善した。
  • 実際の潰瘍性大腸炎データでは、CATEと比較して本手法はより分散が大きく、よりキャリブレーションの良い検定統計量を生成し、検定統計量の相関は0.75であったが、FDR < 0.1の基準で重複する有意な遺伝子は1つ(DPP10-AS1)にとどまった。
  • 本手法は、予期しないサンプルワイド相関を内挿的に考慮することで、ゲノムコントロールのような後処理の調整に依存する必要性を低減する。
  • 本アルゴリズムは、AR1、スターブロック、Erdős-Rényiランダムグラフモデルを含む多様な依存構造において、強固な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。