Skip to main content
QUICK REVIEW

[論文レビュー] Joint Mean-Covariance Estimation via the Horseshoe with an Application in Genomic Data Analysis

Yunfan Li, Jyotishka Datta|arXiv (Cornell University)|Mar 15, 2019
Gene expression and cancer classification参考文献 31被引用数 5
ひとこと要約

本稿では、高次元の見かけ上関連のない回帰(SUR)に対して、ホーシュープライアとグラフィカルホーシュープライアを用いた完全ベイズ型同時平均・分散共分散推定法を提案する。この手法により、予測子の数に対して線形時間でサンプリングが可能となり、eQTL解析において、回帰係数と精度行列の要素を同時に縮小しつつ、スパarsityを維持し、不確実性の定量化を可能にする。

ABSTRACT

Seemingly unrelated regression is a natural framework for regressing multiple correlated responses on multiple predictors. The model is very flexible, with multiple linear regression and covariance selection models being special cases. However, its practical deployment in genomic data analysis under a Bayesian framework is limited due to both statistical and computational challenges. The statistical challenge is that one needs to infer both the mean vector and the inverse covariance matrix, a problem inherently more complex than separately estimating each. The computational challenge is due to the dimensionality of the parameter space that routinely exceeds the sample size. We propose the use of horseshoe priors on both the mean vector and the inverse covariance matrix. This prior has demonstrated excellent performance when estimating a mean vector or inverse covariance matrix separately. The current work shows these advantages are also present when addressing both simultaneously. A full Bayesian treatment is proposed, with a sampling algorithm that is linear in the number of predictors. MATLAB code implementing the algorithm is freely available from github at https://github.com/liyf1988/HS_GHS. Extensive performance comparisons are provided with both frequentist and Bayesian alternatives, and both estimation and prediction performances are verified on a genomic data set.

研究の動機と目的

  • 高次元ゲノムデータにおけるベイズフレームワーク下での同時平均および分散共分散推定の統計的・計算的課題に取り組むこと。
  • 見かけ上関連のない回帰(SUR)において、スパースな回帰係数とスパースな精度行列を同時に推定できるスケーラブルな完全ベイズ手法を開発すること。
  • 既存のベイズ手法が予測子-応答関係に制限的な仮定を必要としたり、スケーラビリティに欠けるなどの制限を克服すること。
  • 完全なギブスサンプリングにより不確実性の定量化と自動チューニングを可能にし、予測子の数に対して線形の複雑度を持つこと。

提案手法

  • 高次元平均推定におけるスパarsityと縮小を実現するため、回帰係数にホーシュープライアを適用する。
  • 精度行列のスパarsityと条件付き独立構造のモデル化を促進するため、逆分散共分散行列にグラフィカルホーシュープライアを適用する。
  • 両方のプライアを統合し、平均および分散共分散パラメータの同時推定に適した統一されたHS-GHS(ホーシューブ・グラフィカルホーシューブ)プライアを構築する。
  • 予測子の数に対して線形スケーリング、応答変数の数に対して立方スケーリングを達成する完全なギブスサンプリングアルゴリズムを開発し、事後分布の効率的探索を可能にする。
  • 平均および精度行列のための共役サンプリングステップを容易にするために、連合推定問題を分離する再パラメータ化戦略を採用する。
  • MATLABでアルゴリズムを実装し、再現性およびゲノム分野への応用を目的にGitHubで公開する。

実験結果

リサーチクエスチョン

  • RQ1完全ベイズ型同時推定フレームワークが、個別推定や頻度主義的手法と比較して、高次元eQTL解析において優れた性能を発揮できるか?
  • RQ2HS-GHSプライアが平均および精度行列推定に同時に用いられた場合、最小最大性や最適Kullback–Leiblerリスクといった理論的性質を保持できるか?
  • RQ3提案されたギブスサンプラーが予測子の数に応じて効率的にスケーリングされつつ、高次元設定でも正確な事後推定を維持できるか?
  • RQ4平均と分散共分散の連合モデリングは、応答変数を個別にモデル化する場合と比較して、推定および予測精度をどのように向上させるか?
  • RQ5ホーシュープライアのグローバル-ローカル構造が、eQTLマッピングにおける不確実性の定量化および誤発見率の制御に与える影響は何か?

主な発見

  • 提案されたHS-GHS手法は、予測子の数に対して線形の計算複雑度を達成しており、高次元ゲノムデータにスケーラブルである。
  • 実際のeQTLデータセットにおいて、頻度主義的手法およびベイズ的手法の両方の競合手法と比較して、推定および予測性能が顕著に向上しており、特に真のスパースな関連を同定する点で優れている。
  • 完全ベイズフレームワークにより、事後分布のキャリブレーションが示されたように、不確実性の定量化において良好な頻度的カバレッジが得られた。
  • 平均にホーシュープライア、精度行列にグラフィカルホーシュープライアを適用することで、遺伝子発現データの複雑な依存構造に適応しつつ、スパarsityを共同で維持した。
  • 理論的分析により、HS-GHS事後分布の濃縮レートが対数要因を除き最適であることが確認され、高次元領域における一貫性を支持する。
  • 実証的比較により、すべての予測子がすべての応答に影響すると仮定するか、すべてに影響しないと仮定する既存のベイズ手法とは異なり、任意のスパースパターンを許容できることから、本手法が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。