Skip to main content
QUICK REVIEW

[論文レビュー] Testing to distinguish measures on metric spaces

Andrew J. Blumberg, Prithwish Bhaumik|arXiv (Cornell University)|Feb 4, 2018
Topological and Geometric Data Analysis参考文献 15被引用数 4
ひとこと要約

この論文は、測度空間上の測度を区別するための非パラメトリックな二標本仮説検定を提案している。この手法は、対間距離とGromovのmm再構成定理を用いる。各標本の最小行和点からの距離の経験的分布に対してKolmogorov–Smirnov検定を適用することで、基礎的な測度の差を効率的に検出できる。実際のインフルエンザデータと合成例において、エネルギー検定よりも優れた速度と検出力を持つことが示された。

ABSTRACT

We study the problem of distinguishing between two distributions on a metric space; i.e., given metric measure spaces $({\mathbb X}, d, μ_1)$ and $({\mathbb X}, d, μ_2)$, we are interested in the problem of determining from finite data whether or not $μ_1$ is $μ_2$. The key is to use pairwise distances between observations and, employing a reconstruction theorem of Gromov, we can perform such a test using a two sample Kolmogorov--Smirnov test. A real analysis using phylogenetic trees and flu data is presented.

研究の動機と目的

  • 非ユークリッド的測度空間(例えば系統発生樹)から得られるデータにおける二標本仮説検定の課題に対処すること。
  • パラメトリックな仮定を避けて、ユークリッド空間への埋め込みではなく、内在的な幾何的構造を活用する手法を開発すること。
  • 計算コストの高いパーミュテーションに基づく臨界値推定を要するエネルギーベースの検定に対する、計算効率の良い代替手法を提供すること。
  • 特に異なる季節のインフルエンザ系統発生樹を用いた実世界データに対して手法を検証し、生物学的推論における有用性を評価すること。
  • 測度がスケールや位置でのみ異なる場合でも高い検出力を維持し、フリーチェ平均が存在しない場合にも頑健であることを示すこと。

提案手法

  • 測度空間を等長写像に関して特徴付けるGromovのmm再構成定理を活用する。
  • 各標本について、距離行列 $ M_{ij} = d(x_i, x_j) $ を計算し、行和 $ \sum_{i \neq j} d(x_j, x_i) $ が最小となる点 $ x_{i_X} $ を特定する。この点はフリーチェ平均の代理として機能する。
  • 距離 $ d(x_{i_X}, x_i) $($ i \neq i_X $)の経験的分布関数を構築し、同様に第二標本に対しても同様の処理を行う。
  • 二標本Kolmogorov–Smirnov検定をこれらの二つの経験的分布関数に適用し、基礎的な測度が等しいかどうかを評価する。
  • 最小行和点からの距離分布が同一であれば、基礎的な測度は等長写像を除いて同一であるという事実を応用する。
  • 系統発生樹上のBHV距離を高速に計算するアルゴリズムを用いて、実際の生物学的データへのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1有限の標本と対間距離のみを用いて、一般の測度空間上での二つの確率測度を区別できるか?
  • RQ2パラメトリックモデルを避けて計算効率の良い非パラメトリックな二標本検定をどのように構築できるか?
  • RQ3基礎的な測度がスケールや位置でのみ異なる場合でも、提案手法は高い統計的検出力を維持するか?
  • RQ4この手法は、系統発生樹の空間など非ユークリッド的空間にも効果的に適用できるか?
  • RQ5特に大規模データセットにおいて、提案手法は二標本エネルギー検定と比べて検出力と速度の点で優れているか?

主な発見

  • 1996年と2007年のインフルエンザデータを比較した際、有意水準95%で帰無仮説が有意に棄却され、基礎的な測度が異なることが示された。
  • エネルギー検定に比べて計算効率に優れており、計算コストの高いパーミュテーションに基づく臨界値推定を要する点で顕著な利点を示した。
  • 1996年のインフルエンザシーズンのスプリットデータに適用した際、帰無仮説が有意に棄却されず、内部の一貫性と分布の安定性が確認された。
  • スケールの違いを検出する際、エネルギー検定を上回る高い検出力を示した。
  • フリーチェ平均が存在しない場合でも、最小行和点をフリーチェ平均の代理として用いることで、頑健な検定が可能となった。
  • 最小行和点からの距離分布関数は、滑らかで安定しており、Kolmogorov–Smirnov検定の適用の妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。