Skip to main content
QUICK REVIEW

[論文レビュー] Selective Inference for Hierarchical Clustering

Lucy L. Gao, Jacob Bien|arXiv (Cornell University)|Dec 5, 2020
Gene expression and cancer classification被引用数 6
ひとこと要約

本論文は、階層的クラスタリングによって形成されたクラスタ間の平均値の差を検定するための選択的仮説検定フレームワークを提案する。この手法は、データに依存する仮説選択を考慮し、クラスタリングの結果を条件付きにして正確なp値を計算することで、選択的第一種誤り率を制御する。クラスタリングに使用した同一のデータからクラスタが推定される状況においても、有効な推論が可能であることを検証する。

ABSTRACT

Classical tests for a difference in means control the type I error rate when the groups are defined a priori. However, when the groups are instead defined via clustering, then applying a classical test yields an extremely inflated type I error rate. Notably, this problem persists even if two separate and independent data sets are used to define the groups and to test for a difference in their means. To address this problem, in this paper, we propose a selective inference approach to test for a difference in means between two clusters. Our procedure controls the selective type I error rate by accounting for the fact that the choice of null hypothesis was made based on the data. We describe how to efficiently compute exact p-values for clusters obtained using agglomerative hierarchical clustering with many commonly-used linkages. We apply our method to simulated data and to single-cell RNA-sequencing data.

研究の動機と目的

  • クラスタリングに使用した同一のデータからクラスタを推定したのちに、そのクラスタ間の平均値の差を検定する場合に生じる第一種誤り率の上昇を解消すること。
  • 帰無仮説がデータに基づいて選択されるという事実を統計的枠組みに組み込むこと。これは古典的推論の仮定を破るため、その修正が必要である。
  • 共通のリンクージング(単一、平均、完全、重心)を用いた凝集型階層的クラスタリングにおける、平均値の差の検定に正確なp値を提供すること。
  • 単一細胞RNA-Seqデータのような高次元設定においても、クラスタベースの仮説検定が広く行われていることを踏まえ、有効な推論を保証すること。

提案手法

  • 本手法は、観測されたクラスタリング結果を条件として、選択的仮説検定を用いて正確なp値を計算する。クラスタリングの結果をランダムな選択メカニズムとして扱う。
  • 検定統計量(クラスタ平均値の差)を、観測されたクラスタリング構造によって定義される領域で切断されたカイ二乗分布としてモデル化する。
  • p値は、帰無仮説の下で、観測された統計量を超える確率を、クラスタリング結果が選択された条件付きで計算する。
  • 本手法は、単一、平均、完全、重心リンクージングを用いた凝集型階層的クラスタリングに適用可能であり、条件付き分布の閉形式表現を用いる。
  • クラスタがデータから推定されることを考慮することで、仮説検定における選択バイアスを是正する。
  • 帰無仮説の下での検定統計量の選択的標本分布を導出し、同一のデータをクラスタリングと検定の両方に使用する状況でも有効な推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1同一のデータからクラスタを推定したのちに、そのクラスタ間の平均値の差を検定する有効な仮説検定を構築できるか?
  • RQ2データに依存するクラスタ選択が、古典的t検定やWald検定における第一種誤り率にどのように影響するか?
  • RQ3帰無仮説がデータに基づいて選択された場合に、検定統計量の正しい標本分布は何か?
  • RQ4階層的クラスタリングにおいて、選択的第一種誤り率を制御する正確なp値を計算できるか?
  • RQ5提案手法の検出力は、効果量、クラスタサイズ、リンクージングタイプにどのように依存するか?

主な発見

  • 本手法はクラスタリング結果を条件としているため、古典的Wald検定で見られる深刻な第一種誤り率の上昇を回避し、選択的第一種誤り率を制御する。
  • クラスタリング後に適用される古典的検定は、独立した訓練・テストセットを用いても、非常に反保守的(anti-conservative)なp値を示し、第一種誤り率が名目水準を著しく上回る。
  • サンプル分割でも問題は解決しない。なぜなら、テストセットのクラスタ割り当てもデータ駆動型のクラスタ選択に依存しており、標準的推論の前提が破られるからである。
  • 単一、平均、完全、重心の全リンクージングにおいて有効な推論が達成され、帰無仮説が真である場合にp値は一様分布に従う。
  • 検出力は効果量Δに比例して増加し、小規模なクラスタに対しても十分な検出力を維持するが、min{|C₁|, |C₂|} < 10 では検出力が低下する。
  • 検定統計量が選択領域の境界に近づくとp値が上昇する傾向が見られ、これは選択的仮説検定理論に整合する条件付き推論の性質を反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。