Skip to main content
QUICK REVIEW

[論文レビュー] Classification accuracy as a proxy for two sample testing

Ilmun Kim, Aaditya Ramdas|arXiv (Cornell University)|Feb 6, 2016
Advanced Statistical Methods and Models参考文献 45被引用数 12
ひとこと要約

この論文は、高次元設定において分類精度が二標本検定の有効で強力な代理統計量であることを確立している。真の分類精度が確率的偶然より任意の固定されたマージン($C\epsilon > 0$)以上に上回る場合、パーミュテーションに基づく検定およびガウス近似に基づく検定の両方が一貫性を示すことを証明している。驚くべきことに、フィッシャーの線形判別分析(LDA)は、バランスの取れたガウスモデル下でホットテリングの $T^2$ 検定と比較して漸近的相対効率 $1/\sqrt{\pi}$ を達成しており、近似的に最適な性能を示している。

ABSTRACT

When data analysts train a classifier and check if its accuracy is significantly different from chance, they are implicitly performing a two-sample test. We investigate the statistical properties of this flexible approach in the high-dimensional setting. We prove two results that hold for all classifiers in any dimensions: if its true error remains $ε$-better than chance for some $ε>0$ as $d,n o \infty$, then (a) the permutation-based test is consistent (has power approaching to one), (b) a computationally efficient test based on a Gaussian approximation of the null distribution is also consistent. To get a finer understanding of the rates of consistency, we study a specialized setting of distinguishing Gaussians with mean-difference $δ$ and common (known or unknown) covariance $Σ$, when $d/n o c \in (0,\infty)$. We study variants of Fisher's linear discriminant analysis (LDA) such as "naive Bayes" in a nontrivial regime when $ε o 0$ (the Bayes classifier has true accuracy approaching 1/2), and contrast their power with corresponding variants of Hotelling's test. Surprisingly, the expressions for their power match exactly in terms of $n,d,δ,Σ$, and the LDA approach is only worse by a constant factor, achieving an asymptotic relative efficiency (ARE) of $1/\sqrtπ$ for balanced samples. We also extend our results to high-dimensional elliptical distributions with finite kurtosis. Other results of independent interest include minimax lower bounds, and the optimality of Hotelling's test when $d=o(n)$. Simulation results validate our theory, and we present practical takeaway messages along with natural open problems.

研究の動機と目的

  • 高次元データにおける二標本仮説検定の代理として分類精度を用いる統計的妥当性および検出力の検討。
  • 標本サイズと次元が増大する中で、分類器に基づく検定が第1種過誤制御を維持し、一貫性を示す条件の特定。
  • 高次元漸近的設定下で、分類器に基づく検定(例:LDA、ナイーブベイズ)と古典的パラメトリック検定(例:ホットテリングの $T^2$)の検出力の比較。
  • 分類精度を用いたパーミュテーションベースおよびガウス近似ベースの推論に対する理論的保証の確立。
  • 特定の分布仮定下で、分類器に基づく検定と最適なパラメトリック検定との相対的効率の評価。

提案手法

  • 分類精度を二標本検定の検定統計量として用いる一般的な枠組みを提案し、誤差率推定のためのサンプル分割を活用する。
  • 分類誤差の帰無分布に対するガウス近似に基づく検定を導入し、分類器にやや弱い正則性条件が課せられる場合の漸近的第1種過誤制御を証明する。
  • 分類精度のパーミュテーション検定を分析し、ガウス近似法と同一の条件下で一貫性を示すことを示す。
  • LDAおよびナイーブベイズ分類器について、高次元極限($d/n \to c \in (0,\infty)$)下での分類誤差の漸近的分布を導出する。
  • 有限峰度を有する多変量正規分布および楕円対称分布下で、LDAおよびナイーブベイズの検出力とホットテリングの $T^2$ 検定を比較する。
  • ミニマックス下界と漸近的相対効率(ARE)分析を用いて、手法の最適性および相対的性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1分類精度が高次元における二標本検定の一致する統計量となる条件は何か?
  • RQ2高次元漸近的設定下で、分類器に基づく検定の検出力は、ホットテリングの $T^2$ などの古典的パラメトリック検定と比べてどの程度か?
  • RQ3バランスの取れたガウスモデル下で、LDAおよびナイーブベイズのホットテリングの $T^2$ に対する漸近的相対効率(ARE)は何か?
  • RQ4分類誤差の帰無分布に対するガウス近似を用いて、妥当かつ計算効率の良い検定を構築できるか?
  • RQ5サンプル分割比は、分類に基づく検定の実効的検出力にどのように影響するか?

主な発見

  • 分類器の真の精度が $n,d \to \infty$ の下で確率的偶然より任意の固定マージン $\epsilon > 0$ 以上に上回る場合、パーミュテーション検定およびガウス近似ベースの検定の両方が一貫性を示す(検出力 $\to 1$)。
  • 平均差 $\delta$ と共通共分散 $\Sigma$ を有するバランスの取れたガウスモデル下で、LDAとホットテリングの $T^2$ 検定の検出力は、$n,d,\delta,\Sigma$ の観点で正確に一致する。
  • ホットテリングの $T^2$ に対するLDAの漸近的相対効率(ARE)は、バランスの取れたサンプルでは $1/\sqrt{1.5\pi} \approx 0.43$ であるが、正しく解釈された結果では $1/\sqrt{\pi} \approx 0.58$ とされる。
  • ガウス近似ベースの検定は、分類器にやや弱い正則性条件が課せられる場合、漸近的第1種過誤制御を達成する。
  • パーミュテーション検定は、パーミュテーション数が $n$ および $d$ と共に十分に増加する場合、同じ条件下で一貫性を示す。
  • シミュレーション結果から、実効的検出力はバランスの取れたサンプル分割比($\kappa = 0.5$)で最大値を示すが、$\kappa$ が極端な場合、正規近似が不十分になるため有限標本では非対称性が現れる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。