Skip to main content
QUICK REVIEW

[論文レビュー] Empirical Bayes Matrix Factorization

Wei Wang, Matthew Stephens|PubMed|Feb 20, 2018
Gene expression and cancer classification参考文献 66被引用数 20
ひとこと要約

この論文は、多変量解析におけるスパース行列因子分解の精度と解釈可能性を向上させるために、データからスパarsity誘導型事前分布を推定する柔軟なフレームワーク、Empirical Bayes Matrix Factorization (EBMF) を導入する。変分近似を用いて問題をより単純な「正規平均問題」に還元することで、EBMF は因子と負荷のスパarsityレベルをデータに適応的に調整し、シミュレーションおよび実際の GTEx 遺伝子データにおいて、既存の手法を上回る精度と解釈可能性を達成する。

ABSTRACT

Matrix factorization methods, which include Factor analysis (FA) and Principal Components Analysis (PCA), are widely used for inferring and summarizing structure in multivariate data. Many such methods use a penalty or prior distribution to achieve sparse representations ("Sparse FA/PCA"), and a key question is how much sparsity to induce. Here we introduce a general Empirical Bayes approach to matrix factorization (EBMF), whose key feature is that it estimates the appropriate amount of sparsity by estimating prior distributions from the observed data. The approach is very flexible: it allows for a wide range of different prior families and allows that each component of the matrix factorization may exhibit a different amount of sparsity. The key to this flexibility is the use of a variational approximation, which we show effectively reduces fitting the EBMF model to solving a simpler problem, the so-called "normal means" problem. We demonstrate the benefits of EBMF with sparse priors through both numerical comparisons with competing methods and through analysis of data from the GTEx (Genotype Tissue Expression) project on genetic associations across 44 human tissues. In numerical comparisons EBMF often provides more accurate inferences than other methods. In the GTEx data, EBMF identifies interpretable structure that agrees with known relationships among human tissues. Software implementing our approach is available at https://github.com/stephenslab/flashr.

研究の動機と目的

  • スパース行列因子分解における最適なスパarsityレベルの選択という課題に取り組むこと。これは、解釈可能性と精度の両面で極めて重要である。
  • 観測データから直接負荷と因子の事前分布を推定する、柔軟でデータ適応型の手法を開発すること。
  • 特にゲノム学および機能データ解析において、高次元多変量データにおける推論の精度と解釈可能性を向上させること。
  • 既存のスパース FA/PCA 手法を一般化するスケーラブルで計算的に効率的なフレームワークを提供すること。
  • 数値比較と GTEx 組織発現データへの実世界応用を通じて、本手法の優位性を示すこと。

提案手法

  • EBMF は、観測データ行列から直接負荷と因子のスパarsity誘導型事前分布を経験的ベイズ的手法で推定する。
  • 複雑な後部推定問題をより単純な「正規平均問題」に変換するために変分近似を適用し、計算を効率化する。
  • 各成分に固有の事前分布を推定することで、因子分解の異なる成分が異なるスパarsityレベルを持つことを可能にする。
  • スパarsityをサポートしつつ計算的扱いやすさを維持するため、一様で単峰型の事前分布(例:ラプラス分布、ホースシューディスト分布)の柔軟なクラスを採用する。
  • ペナルティ付き正規平均推定に基づくグリーディーまたはバックフィッティング戦略を用いて、反復的に負荷、因子、事前分布ハイパーパrameterを更新する。
  • 行と列のホールアウトパターンをバランスさせるために、モデル性能を公平に評価するための新規な直交交差検証(OCV)スキームを導入する。

実験結果

リサーチクエスチョン

  • RQ1固定されたペナルティパラメータに依存せず、データに応じてスパース性を適応的に調整する方法は何か?
  • RQ2事前分布の経験的ベイズ推定が、高次元データにおけるスパース行列因子分解の精度と解釈可能性を向上させられるか?
  • RQ3実際のゲノムデータにおいて、EBMF は既存のスパース FA/PCA 手法と比べて、再構成誤差と生物学的解釈可能性の面で優れているか?
  • RQ4データ適応型事前分布推定戦略が、多様なデータ構造にわたるモデルの安定性と性能に与える影響は何か?
  • RQ5新規な直交交差検証(OCV)スキームは、要因モデルにおける標準的な k フォールド CV よりも信頼性の高いモデル選択を可能にするか?

主な発見

  • 数値比較において EBMF は、多様なシミュレーション設定において、他の手法を常に上回り、低い再構成誤差と向上した推定精度を達成する。
  • GTEx データにおいて、EBMF は既知のヒト組織間の機能的関係と整合する生物学的に解釈可能な組織特異的遺伝子発現パターンを効果的に同定する。
  • 負荷と因子における非一様なスパarsityの学習が効果的に実現され、一部の成分は密である一方で他の成分は非常にスパースになるようになり、元のデータ構造を反映する。
  • 変分近似の使用により、大規模なゲノムおよび多変量データセットへのスケーラブルな推論が可能になる。
  • 直交交差検証(OCV)は、訓練集合と検証集合にすべてのサンプルと特徴量が均等に含まれるようバランスを取った信頼性の高いモデル選択手法を提供する。
  • ソフトウェア実装は https://github.com/stephenslab/flashr で公開されており、再現性と広範な採用を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。