Skip to main content
QUICK REVIEW

[論文レビュー] A nonparametric Bayesian test of dependence

Yimin Kao, Brian J. Reich|arXiv (Cornell University)|Jan 28, 2015
Bayesian Methods and Mixture Models参考文献 22被引用数 3
ひとこと要約

本稿では、帰無仮説(独立性)と対立仮説(依存性)の両方においてディリクレ過程混合(DPM)事前分布を用いた、非パラメトリックベイズ的依存性検定を提案する。この検定は、可逆移動MCMCを用いて対立仮説の事後確率を計算し、従来の手法と比較して線形および複雑な非線形依存性を検出するパワーに優れている。特に遺伝子発現データ解析において、従来検出できなかった依存構造を同定する。

ABSTRACT

In this article, we propose a new method for the fundamental task of testing for dependence between two groups of variables. The response densities under the null hypothesis of independence and the alternative hypothesis of dependence are specified by nonparametric Bayesian models. Under the null hypothesis, the joint distribution is modeled by the product of two independent Dirichlet Process Mixture (DPM) priors; under the alternative, the full joint density is modeled by a multivariate DPM prior. The test is then based on the posterior probability of favoring the alternative hypothesis. The proposed test not only has good performance for testing linear dependence among other popular nonparametric tests, but is also preferred to other methods in testing many of the nonlinear dependencies we explored. In the analysis of gene expression data, we compare different methods for testing pairwise dependence between genes. The results show that the proposed test identifies some dependence structures that are not detected by other tests.

研究の動機と目的

  • 線形および非線形の関連性を両方検出できる、柔軟な非パラメトリックベイズ的依存性検定を開発すること。
  • カイ二乗検定やフーディングの検定といった古典的手法の限界を解決すること。これらの手法はデータの分割に敏感であり、複雑な依存関係に対してパワーに欠ける。
  • 距離相関や最大情報係数といった既存の非パラメトリック検定を改善すること。両仮説下で非パラメトリック事前分布を組み込んだ完全なベイズモデルを導入する。
  • 特にゲノム研究や機能的結合性解析において、高次元データにおける依存性のロバストな検出を可能にすること。
  • 一貫したベイズ枠組み内で依存性の証拠を定量化する、事後確率に基づく検定を提供すること。

提案手法

  • 帰無仮説下での応答密度を、2つの変数群それぞれに独立したディリクレ過程混合(DPM)事前分布を用いてモデル化する。
  • 対立仮説下での同時密度を、複雑で因数分解不能な依存構造を許容する多変量DPM事前分布を用いてモデル化する。
  • 可逆移動マルコフ連鎖モンテカルロ(RJ-MCMC)を用いて、対立仮説の事後確率を計算し、次元数の異なる構成のモデル空間を探索可能にする。
  • DPMの集中パrameterに非情報的事前分布を指定することで、客観的な推論を保証する。
  • 対立モデルの事後オッズに基づく検定統計量を計算し、有意性は事後確率の閾値によって評価する。
  • 各データセットに対して帰無仮説下で300個の順列サンプルを用いて第一種の誤り率を制御し、他の非パラメトリック検定と整合性を保つ。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックベイズ的手法は、線形および非線形の依存性を両方検出する点で、古典的および現代的な非パラメトリック検定を上回ることができるか?
  • RQ2距離相関やHHGといった既存の検定のp値と比較して、対立仮説の事後確率は、さまざまな依存構造においてどのように異なるか?
  • RQ3提案手法は、遺伝子発現プロファイルのような高次元データにおいて、複雑な非線形依存パターンをどの程度検出できるか?
  • RQ4帰無仮説と対立仮説の両方において非パラメトリックベイズモデルを用いることで、パラメトリックまたは半パラメトリックな代替手法と比較して検出パワーが向上するか?
  • RQ5依存性が微弱または非線形である可能性のある実世界のゲノムデータにおいて、この検定はどの程度の性能を示すか?

主な発見

  • シミュレーションのあらゆるシナリオにおいて、ピアソンの積率相関、スピアーマンのrho、カイ二乗検定、フーディングの検定、距離相関、HHGと比較して、本手法は線形および非線形依存性の検出において高い統計的パワーを達成した。
  • 遺伝子発現データ解析において、本手法は他のすべての手法が見逃していた対ごとの遺伝子依存性を同定し、複雑で非線形な関係に対する感受性を示した。
  • 対立仮説の事後確率は、依存性の証拠を一貫的かつ解釈可能な形で提供し、p値に基づくアプローチに比べて微弱な関連性の検出において優れた性能を示した。
  • 単調、円形、放物線的関係を含む多様な依存構造においても、本手法はロバストな性能を示した。これらの構造では、従来の手法がしばしば失敗する。
  • 可逆移動MCMCの使用により、モデル空間の効率的探索が可能となり、高次元設定下でも事後モデル確率の正確な計算が可能になった。
  • 帰無仮説下で300個の順列サンプルを用いて評価した結果、有意水準0.05における第一種の誤り率が適切に制御された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。