Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Structured Sparsity from Gaussian Fields

Barbara E. Engelhardt, Ryan P. Adams|arXiv (Cornell University)|Jul 8, 2014
Genetic and phenotypic traits in livestock参考文献 50被引用数 12
ひとこと要約

本論文は、ガウス過程を用いて回帰係数の類似性に基づく縮約を誘導するベイジアン構造的スパarsityモデルを提案する。楕円型スライスサンプリングを用いることで、計算が tractable なものとなる。特徴の類似性、事後包含確率、モデル平均化を活用することで、遺伝子データ解析において既存手法を上回る感度と精度を実現する。

ABSTRACT

Substantial research on structured sparsity has contributed to analysis of many different applications. However, there have been few Bayesian procedures among this work. Here, we develop a Bayesian model for structured sparsity that uses a Gaussian process (GP) to share parameters of the sparsity-inducing prior in proportion to feature similarity as defined by an arbitrary positive definite kernel. For linear regression, this sparsity-inducing prior on regression coefficients is a relaxation of the canonical spike-and-slab prior that flattens the mixture model into a scale mixture of normals. This prior retains the explicit posterior probability on inclusion parameters---now with GP probit prior distributions---but enables tractable computation via elliptical slice sampling for the latent Gaussian field. We motivate development of this prior using the genomic application of association mapping, or identifying genetic variants associated with a continuous trait. Our Bayesian structured sparsity model produced sparse results with substantially improved sensitivity and precision relative to comparable methods. Through simulations, we show that three properties are key to this improvement: i) modeling structure in the covariates, ii) significance testing using the posterior probabilities of inclusion, and iii) model averaging. We present results from applying this model to a large genomic dataset to demonstrate computational tractability.

研究の動機と目的

  • 特徴の類似性をガウス過程事前分布を用いて組み込んだ、構造的スパarsityを実現するベイジアンフレームワークの構築を目的とする。
  • 高次元回帰設定($p \gg n$)においても計算が tractable であり、特徴の包含に関する明示的な事後分布推論を維持できるようにすることを目的とする。
  • 共変数の構造をモデル化し、事後包含確率を用いた有意性検定を行うことで、遺伝子データにおける真の関連の検出を向上させることを目的とする。
  • 任意の類似性測度に適応可能な柔軟で汎用的な事前分布を提供することを目的とする。ここで、正定値カーネルを用いて実現する。
  • 大規模な遺伝子データセットにおいて、計算の tractability と統計的優位性を実証することを目的とする。

提案手法

  • 本手法は、プロビット回帰モデルの潜在変数にガウス過程事前分布を適用することで、回帰係数における構造的スパarsityを誘導する。
  • スパイクアンドスラブ事前分布を連続的かつ tractable な形に緩和するため、正規分布のスケール混合を用いる。これにより、事後包含確率が保持される。
  • 潜在ガウス場は楕円型スライスサンプリングを用いてサンプリングされ、高次元設定でも効率的な事後分布計算が可能になる。
  • 特徴の類似性は、任意の正定値カーネル行列を介してエンコードされ、ドメイン固有の類似性測度が縮約を導く。
  • 特徴選択におけるサンプルバイアスへの感受性を低減し、ロバスト性を向上させるために、モデル平均化が適用される。
  • 局所的正則化項を変更することで、グループ内に密集したスパarsity(dense-within-groups)およびグループ内に疎なスパarsity(sparse-within-groups)の両方の適応が可能となる。

実験結果

リサーチクエスチョン

  • RQ1ガウス過程を用いて特徴の類似性を活用するベイジアン構造的スパarsityモデルは、高次元回帰における感度と精度を向上させることができるか?
  • RQ2包含確率に潜在ガウス場を組み込むことで、標準的なペナルティ法や非ベイジアン手法と比較して、モデル選択性能にどのような影響を与えるか?
  • RQ3事後包含確率とモデル平均化は、弱い関連を持つ予測変数の検出における統計的パワーをどの程度向上させるか?
  • RQ4本手法は、数百万個のSNPを含む大規模な遺伝子データセットに計算的にスケーリング可能か?
  • RQ5特徴類似性を測定するためのカーネルの選択が、構造的データにおける真の関連の回復にどの程度影響を与えるか?

主な発見

  • 提案モデルは、定量的形質に関連する遺伝子変異の同定において、類似手法と比較して顕著に向上した感度と精度を達成した。
  • シミュレーションにより、3要因——共変数構造のモデル化、事後包含確率による有意性検定、モデル平均化——が性能向上の鍵であることが示された。
  • 本手法は大規模な遺伝子データセットでも計算が tractable を維持し、数万名の個体と最大4000万個のSNPを含む研究への応用が可能となった。
  • ガウス過程事前分布の使用により、予測変数間の任意の類似性測度の柔軟な統合が可能となり、ドメイン固有の構造への適応性が向上した。
  • グループ内に密集した選択を強制するグループスパarsity手法よりも優れた性能を示し、より解釈可能で統計的パワーの高い疎な解を得た。
  • ゲノムのウィンドウを並列化することでスケーラブルな推論が可能であり、マルチスケールまたは変分法によるさらなるスケーリングも可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。