Skip to main content
QUICK REVIEW

[論文レビュー] RSVP-graphs: Fast High-dimensional Covariance Matrix Estimation under Latent Confounding

Rajen D. Shah, Benjamin Frot|arXiv (Cornell University)|Nov 2, 2018
Statistical Methods and Inference参考文献 30被引用数 4
ひとこと要約

本稿では、観測データをデータ行列の右特異ベクトルに投影することにより、潜在的交絡要因が存在する下での高次元共分散行列の推定を高速かつスケーラブルに実現するRSVPグラフを提案する。この手法は、真の共分散行列を未知のスケール要因まで回復するため、共分散行列の推定が困難な状況下でも相関行列やネットワーク構造の推定が安定的に行える。

ABSTRACT

In this work we consider the problem of estimating a high-dimensional $p imes p$ covariance matrix $Σ$, given $n$ observations of confounded data with covariance $Σ+ ΓΓ^T$, where $Γ$ is an unknown $p imes q$ matrix of latent factor loadings. We propose a simple and scalable estimator based on the projection on to the right singular vectors of the observed data matrix, which we call RSVP. Our theoretical analysis of this method reveals that in contrast to PCA-based approaches, RSVP is able to cope well with settings where the smallest eigenvalue of $Γ^T Γ$ is close to the largest eigenvalue of $Σ$, as well as settings where the eigenvalues of $Γ^T Γ$ are diverging fast. It is also able to handle data that may have heavy tails and only requires that the data has an elliptical distribution. RSVP does not require knowledge or estimation of the number of latent factors $q$, but only recovers $Σ$ up to an unknown positive scale factor. We argue this suffices in many applications, for example if an estimate of the correlation matrix is desired. We also show that by using subsampling, we can further improve the performance of the method. We demonstrate the favourable performance of RSVP through simulation experiments and an analysis of gene expression datasets collated by the GTEX consortium.

研究の動機と目的

  • 観測されない潜在的要因による交絡が存在する状況下で、高次元共分散行列を推定する課題に対処すること。
  • 潜在的要因の因子負荷行列の固有値と真の共分散行列の固有値が明確に分離されていない場合でも有効な、計算的に効率的な手法を開発すること。
  • 真の共分散行列 Σ を未知の正のスケール要因まで回復すること。このスケール要因の不確実性は、相関行列推定やネットワーク同定の応用において十分である。
  • 潜在的要因の数 q を推定する必要を回避すること。実務ではこの値が不明であり、特定することが難しいことが一般的である。
  • 有限標本における性能を向上させるためにサブサンプリングを適用しながら、楕円分布下でも理論的一貫性と頑健性を維持すること。

提案手法

  • 本手法は、列中心化されたデータ行列 X の右特異ベクトル V を用いて、推定量 Σ̂_rsvp = VV^T を構築する。これを右特異ベクトル投影(RSVP)と呼ぶ。
  • このアプローチは本質的にスケールフリーであり、共分散行列 Σ を未知の正のスカラー要因までしか回復しないが、相関行列推定やネットワーク構造学習には十分である。
  • 潜在的要因の数 q の知識や推定を必要としないため、固有値の分離が弱いか重複している高次元設定でも頑健である。
  • 有限標本における性能向上と推定量の安定性向上を目的として、サブサンプリングを適用する。
  • 理論的分析により、RSVPが広範な条件下で一貫性を保つことが示された。特に、Γ^TΓ の最小固有値が Σ の最大固有値に近い場合でも同様である。
  • 本手法は分布に頑健である:データの行が楕円分布に従う場合、推定量の分布は正規分布下と同一となることが示されており(命題4)、これが成立する。

実験結果

リサーチクエスチョン

  • RQ1潜在的要因の数を事前に知らなくても、高速かつスケーラブルに高次元共分散行列を推定できる手法は存在するか?
  • RQ2潜在的要因と個別ノイズの固有値のギャップが小さい、あるいは存在しない状況下で、この手法はどのように性能を発揮するか?
  • RQ3推定量のスケールフリー性が、相関行列推定やネットワーク同定といった後続の推論に及ぼす影響はどの程度か?
  • RQ4サブサンプリングにより、推定量の有限標本性能が向上し、理論的一貫性が保持されるか?
  • RQ5非正規楕円分布下でも、本手法は頑健性を維持できるか?

主な発見

  • RSVPは、Γ^TΓ の最小固有値が Σ の最大固有値に近い場合でも、真の共分散行列 Σ を未知のスケール要因まで一貫して回復する。
  • 従来の主成分除去手法が、固有値の分離が不十分であるか、または上位主成分の推定が不安定であるために失敗する状況下でも、本手法は有効に機能する。
  • 理論的分析により、RSVPが固有値が急速に発散する場合を含む広範な高次元モデルクラスにおいても一貫性を保つことが確認された。
  • サブサンプリングは、中程度から高次元の設定において、推定量の有限標本性能を顕著に向上させる。
  • 推定量は分布に頑健である:楕円分布下では、その標本分布が正規分布下と同一であることが命題4で証明された。
  • GTEX遺伝子発現データを用いた実証的検証により、RSVPは既存手法を上回り、生物学的に関連性の高い経路の強調や正確な遺伝子ネットワークの構築に優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。