Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Hypothesis Testing in Pattern Discovery

Sami Hanhijärvi, Kai Puolamäki|ArXiv.org|Jun 29, 2009
Data Mining Algorithms and Applications参考文献 12被引用数 6
ひとこと要約

本稿では、パターン発見における多重仮説検定における家族-wise 偽発見率(FWER)を制御する汎用的でパrameterフリーの手法を提案する。ランダム化に基づくp値とホルム=ボンフェローニ補正を用いる。最小p値性質(minP性質)を満たす限り、任意のデータマイニングアルゴリズムに拡張可能な有意性検定へと拡張する。合成データおよび実世界のデータ(頻出部分グラフマイニングを含む)を用いた実験により、高い統計的パワーを維持しながらFWERを制御することを実証した。

ABSTRACT

The problem of multiple hypothesis testing arises when there are more than one hypothesis to be tested simultaneously for statistical significance. This is a very common situation in many data mining applications. For instance, assessing simultaneously the significance of all frequent itemsets of a single dataset entails a host of hypothesis, one for each itemset. A multiple hypothesis testing method is needed to control the number of false positives (Type I error). Our contribution in this paper is to extend the multiple hypothesis framework to be used with a generic data mining algorithm. We provide a method that provably controls the family-wise error rate (FWER, the probability of at least one false positive) in the strong sense. We evaluate the performance of our solution on both real and generated data. The results show that our method controls the FWER while maintaining the power of the test.

研究の動機と目的

  • データマイニングにおける多重仮説検定の課題に対処すること。特に、数千ものパターンが同時にテストされ、第1種の過誤率(Type I error rate)が上昇する問題を解決すること。
  • データ分布やパターンの依存関係に関する仮定を必要とせず、任意のデータマイニングアルゴリズムに適用可能な汎用的なフレームワークを構築すること。
  • 家族-wise 偽発見率(FWER)を強く制御しつつ、過剰な偽陰性を避けるために統計的パワーを維持すること。
  • 取引データやグラフ構造データを含む多様なデータタイプに対して手法を検証し、分野を越えて堅牢であることを示すこと。

提案手法

  • ランダム化を用いて、パターンから得られる検定統計量の帰無分布を生成し、帰無仮説下でのp値推定を可能にする。
  • データマイニングアルゴリズムが最小p値性質(minP性質)を満たすことを要請する。これにより、仮説群のうち最小のp値が確率的に最小となることが保証される。
  • ランダム化されたp値に対してホルム=ボンフェローニ手順を適用し、強い意味でのFWERを制御する。p値は段階的降順に調整される。
  • 各パターンについて、p値は、元のデータの検定統計量を超えるランダム化データの割合として計算される。
  • エッジスワッピングランダム化を用いて、ノード次数を保存する形で、頻出アイテムセットおよび部分グラフマイニングにフレームワークを適用した。
  • 本手法は、パターンの独立性や特定の構造を仮定しないため、一般性が高く、複雑なデータマイニングタスクに適している。

実験結果

リサーチクエスチョン

  • RQ1任意のデータマイニングアルゴリズムに適用可能な汎用的で非パrametricな手法が、家族-wise 偽発見率(FWER)を制御できるか?
  • RQ2特に高次元のパターン空間において、FWERを制御しつつも高い統計的パワーを維持できるか?
  • RQ3最小p値性質(minP性質)は、現実のデータマイニングアルゴリズムにおいて実用的で妥当な仮定であるか?
  • RQ4データ分割や独立性の仮定が成り立たないような複雑なデータ型(例:グラフ)に対しても、本手法は効果的に適用可能か?

主な発見

  • 提案手法は、合成データおよび実データを含む全テストデータセットにおいて、所望の有意水準αで家族-wise 偽発見率(FWER)を適切に制御した。
  • コンパoundグラフデータセット(最小サポート40)において、元のデータでは140個の頻出部分グラフが検出されたが、ランダムデータでは期待値191.8(標準偏差13.4)であった。これは、本手法が非ランダムなパターンを正しく同定していることを示している。
  • すべての実験において最小p値性質(minP性質)が満たされており、p値推定の正当性およびFWER制御の正しさが裏付けられた。
  • 統計的パワーが高く維持されたことが、図8の結果から明らかになった。異なるα水準における有意なパターンの数が一貫して高い水準で維持された。
  • エッジスワッピングランダム化によりノード次数を保存する手法を用いて、グラフ構造データへの適用に成功した。これは、複雑なデータ構造に対しても本フレームワークの堅牢性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。