Skip to main content
QUICK REVIEW

[論文レビュー] Power of Graph-Based Two-Sample Tests

Bhaswar B. Bhattacharya|arXiv (Cornell University)|Aug 30, 2015
Advanced Statistical Methods and Models参考文献 47被引用数 7
ひとこと要約

本稿は、多次元データにおけるグラフベースの2標本検定を統一的な枠組みで提示し、幾何的グラフおよびデータ・デプスのアプローチを一般化する。Le Camの局所漸近正規性を用いて漸近的効率性を導出し、Friedman-RafskyやK-NNのような幾何的グラフ検定は、$O(N^{-1/2})$の代替仮説に対してピットマン効率がゼロであることが示され、デプスベースの検定についても同様に効率性を比較分析する。

ABSTRACT

Testing equality of two multivariate distributions is a classical problem for which many non-parametric tests have been proposed over the years. Most of the popular tests are based either on geometric graphs constructed using inter-point distances between the observations (multivariate generalizations of the Wald-Wolfowitz's runs test) or on multivariate data-depth (generalizations of the Mann-Whitney rank test). These tests are known to be asymptotically normal under the null, and consistent against fixed alternatives. This paper introduces a general notion of graph-based two-sample tests, which includes the tests described above, and provides a unified framework for analyzing their asymptotic properties. The asymptotic efficiency of a general graph-based test is derived using Le Cam's theory of local asymptotic normality, which provides a theoretical basis for comparing the tests. As a consequence, it is shown that tests based on geometric graphs such as the Friedman-Rafsky test (1979), the test based on the $K$-nearest neighbor graph, and the cross-match test of Rosenbaum (2005) have zero asymptotic (Pitman) efficiency against $O(N^{-\frac{1}{2}})$ alternatives. Asymptotic efficiencies of the tests based on multivariate depth functions (the Liu-Singh rank sum statistic (1993)) are also derived from the proposed general theory. Applications of these results are illustrated both on synthetic and real datasets.

研究の動機と目的

  • 幾何的グラフおよびデータ・デプスに基づく既存の非パラメトリック2標本検定を、単一の理論的枠組みに統合すること。
  • 一般化された定式化の下で、グラフベースの2標本検定の漸近的性質を分析すること。
  • Le Camの局所漸近正規性理論を用いて、検定の性能を比較するための漸近的効率性を導出すること。
  • 局所代替仮説に対する幾何的グラフベースの検定(例:Friedman-Rafsky、K-NN、クロスマッチ)の効率性を評価すること。
  • Liu-Singhランク和統計量のようなデプスベースの検定に対しても、効率性分析を拡張すること。

提案手法

  • 点間距離またはデータ・デプスから構築された任意のグラフを用いた、グラフベースの2標本検定の一般クラスを提案する。
  • Le Camの局所漸近正規性理論を適用し、検定の漸近的相対効率性を導出する。
  • 帰無仮説および局所代替仮説の下での検定統計量の漸近的分布を導出する。
  • 検定統計量の漸近的正規性を用いて、連続代替仮説の下でのピットマン効率を計算する。
  • 構築方法に応じて、エッジ数またはグラフ内のデプスベースのランクに基づく検定統計量を構築する。
  • 合成データおよび実世界のデータセットを用いたシミュレーションと実データ応用を通じて、理論的知見を検証する。

実験結果

リサーチクエスチョン

  • RQ1幾何的グラフベースの検定とデプスベースの検定は、どのように単一の理論的枠組みに統合できるか?
  • RQ2局所代替仮説の下で、グラフベースの2標本検定の漸近的効率性は何か?
  • RQ3Friedman-Rafsky や K-NN などの幾何的グラフベースの検定が、$O(N^{-1/2})$の代替仮説に対してなぜ漸近的効率がゼロとなるのか?
  • RQ4Liu-Singh 検定のようなデプスベースの検定は、同じ漸近的枠組み下でどのように効率性を比較できるか?
  • RQ5提案された枠組みは、有限標本設定におけるグラフベースの検定間の性能差を予測できるか?

主な発見

  • Friedman-Rafsky 検定、K-NN グラフ検定、Rosenbaum のクロスマッチ検定を含む幾何的グラフベースの検定は、$O(N^{-1/2})$の代替仮説に対して、漸近的ピットマン効率がゼロである。
  • 提案された一般枠組みにより、幾何的グラフおよびデプスベースの2標本検定の一貫性ある漸近的分析が可能になる。
  • 多次元データ・デプスに基づくLiu-Singhランク和統計量は、同じ理論的枠組み下で非ゼロの漸近的効率性を示すことが明らかになった。
  • 帰無仮説および局所代替仮説の下で、検定統計量の漸近的正規性が確立され、効率性の比較が可能になる。
  • 理論的効率性の結果は、合成データおよび実データへの応用を通じて検証され、予測と整合的であることが示された。
  • この枠組みは、漸近的効率性の性質に基づいて最適なグラフベースの検定を選択する理論的根拠を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。