Skip to main content
QUICK REVIEW

[論文レビュー] Two-Sample Testing in High-Dimensional Models

Nicolas Städler, Sach Mukherjee|arXiv (Cornell University)|Oct 16, 2012
Statistical Methods and Inference参考文献 20被引用数 12
ひとこと要約

本稿では、回帰モデルやガウス graphical モデルなどの多変量二標本検定に一般化可能な、データ分割に基づく手法を提案する。サンプル分割、$\ell_1$-ペナルティ推定、複数分割におけるp値集約を組み合わせることで、重み付きカイ二乗分布としての漸近的正当な推論を達成し、$p \gg n$ であっても信頼性の高い検定を可能にする。この手法は、単一分割における「p値の運試し」を回避し、パーミュテーション検定よりも検出力が優れている。

ABSTRACT

We propose novel methodology for testing equality of model parameters between two high-dimensional populations. The technique is very general and applicable to a wide range of models. The method is based on sample splitting: the data is split into two parts; on the first part we reduce the dimensionality of the model to a manageable size; on the second part we perform significance testing (p-value calculation) based on a restricted likelihood ratio statistic. Assuming that both populations arise from the same distribution, we show that the restricted likelihood ratio statistic is asymptotically distributed as a weighted sum of chi-squares with weights which can be efficiently estimated from the data. In high-dimensional problems, a single data split can result in a "p-value lottery". To ameliorate this effect, we iterate the splitting process and aggregate the resulting p-values. This multi-split approach provides improved p-values. We illustrate the use of our general approach in two-sample comparisons of high-dimensional regression models ("differential regression") and graphical models ("differential network"). In both cases we show results on simulated data as well as real data from recent, high-throughput cancer studies.

研究の動機と目的

  • 高次元二標本問題において $p \gg n$ の状況で、信頼性のある有意性検定が不足しているという問題に対処すること。
  • 高次元回帰やガウス graphical モデルを含む多様なモデルに適用可能な一般化されたフレームワークを構築すること。
  • 単一データ分割の不安定性(「p値の運試し」)を解消するため、繰り返しの分割とp値集約を実施すること。
  • 重み付きカイ二乗の漸近的帰無分布として、理論的裏付けを有するアプローチを提供すること。この分布はデータから推定可能である。
  • がんゲノムプロファイリングにおける差別的ネットワークなど、高スループット生物学的データにおける差別的関係の統計的検定を可能にすること。

提案手法

  • 両群のデータを2つの部分に分割:1つはモデルスクリーニング用、もう1つは検定用。
  • 最初の分割で $\ell_1$-ペナルティ付き最尤推定を用い、活性パラメータ集合を選択することでスパarsityとスクリーニング特性を確保する。
  • 2番目の分割で、非ネストモデル(個別 vs. 結合パラメータ空間)を比較する制限付き尤度比統計量を計算する。
  • 制限付き尤度比統計量の漸近的帰無分布が、独立な $\chi^2$ 変数の重み付き和として与えられることを確立し、重みはデータから推定可能である。
  • 分割プロセスを繰り返し、p値を集約することで、ばらつきを低減し、信頼性を向上させる。
  • 正則化尤度推定を用いて、差別的回帰(高次元線形モデル)および差別的ネットワーク(ガウス graphical モデル)に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1高次元モデル($p \gg n$)に対して、一般化可能な二標本検定フレームワークを開発できるか?
  • RQ2古典的尤度比検定が高次元で破綻する状況において、有意性検定を信頼性を持って行うにはどうすればよいか?
  • RQ3データ分割とp値集約により、高次元設定における単一分割p値の不安定性を緩和できるか?
  • RQ4非ネスト型高次元モデルにおける制限付き尤度比統計量の漸近的帰無分布は何か?
  • RQ5この手法は、がん亜型間での遺伝子調節ネットワークや回帰効果の生物学的に意味のある差を検出できるか?

主な発見

  • 帰無仮説下で制限付き尤度比統計量は、データから一貫して推定可能な重み付きカイ二乗分布に漸近的に従う。
  • 500回の比較におけるp値ヒストограмムの比較から、マルチスプリット手法は単一分割と比べてp値のばらつきが顕著に低減されていることが示された。
  • 皮膚がん対血液がんの細胞線において差別的回帰を適用した結果、マルチスプリット手法ではp値が0.022であったのに対し、パーミュテーション検定では0.220であった。これは、本手法の検出力が優れていることを示している。
  • 肺がん対結腸がんの差別的ネットワーク解析において、両手法ともp値がほぼゼロであったが、マルチスプリット手法では $<10^{-4}$ を記録した。
  • 統合データを用いたバックテストではp値が1に近づき、帰無仮説下でも本手法の妥当性とロバストネスが確認された。
  • 実際にTCGAおよびCCLEの高スループットのがんゲノムプロファイリングデータを用いた解析で、本手法は差別的遺伝子発現およびネットワーク構造を効果的に検出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。