Skip to main content
QUICK REVIEW

[논문 리뷰] Classification accuracy as a proxy for two sample testing

Ilmun Kim, Aaditya Ramdas|arXiv (Cornell University)|2016. 02. 06.
Advanced Statistical Methods and Models참고 문헌 45인용 수 12
한 줄 요약

이 논문은 고차원 설정에서 두표본 검정을 위한 유효하고 강력한 대체 측정으로 분류 정확도를 설정함을 보여준다. 만약 분류기의 진정한 정확도가 우연의 정확도를 어떤 고정된 마진($epsilon > 0$) 이상 초과한다면, 순열 기반 및 가우시안 근사 기반 검정 모두 일致성을 가진다. 놀랍게도 피셔의 선형 판별 분석(LDA)은 균형 잡힌 가우시안 모델 하에서 후켈링의 $T^2$ 검정에 비해 점근적 상대 효율성 $1/\sqrt{\pi}$를 달성하여 거의 최적의 성능을 보인다.

ABSTRACT

When data analysts train a classifier and check if its accuracy is significantly different from chance, they are implicitly performing a two-sample test. We investigate the statistical properties of this flexible approach in the high-dimensional setting. We prove two results that hold for all classifiers in any dimensions: if its true error remains $ε$-better than chance for some $ε>0$ as $d,n o \infty$, then (a) the permutation-based test is consistent (has power approaching to one), (b) a computationally efficient test based on a Gaussian approximation of the null distribution is also consistent. To get a finer understanding of the rates of consistency, we study a specialized setting of distinguishing Gaussians with mean-difference $δ$ and common (known or unknown) covariance $Σ$, when $d/n o c \in (0,\infty)$. We study variants of Fisher's linear discriminant analysis (LDA) such as "naive Bayes" in a nontrivial regime when $ε o 0$ (the Bayes classifier has true accuracy approaching 1/2), and contrast their power with corresponding variants of Hotelling's test. Surprisingly, the expressions for their power match exactly in terms of $n,d,δ,Σ$, and the LDA approach is only worse by a constant factor, achieving an asymptotic relative efficiency (ARE) of $1/\sqrtπ$ for balanced samples. We also extend our results to high-dimensional elliptical distributions with finite kurtosis. Other results of independent interest include minimax lower bounds, and the optimality of Hotelling's test when $d=o(n)$. Simulation results validate our theory, and we present practical takeaway messages along with natural open problems.

연구 동기 및 목표

  • 고차원 데이터에서 두표본 가설 검정을 위한 분류 정확도를 사용하는 통계적 타당성과 검정력에 대해 조사하는 것.
  • 표본 크기와 차원이 증가함에 따라 분류기 기반 검정이 유의수준 제어를 유지하고 일관성을 확보하는 조건을 규명하는 것.
  • 고차원 점근적 설정에서 분류기 기반 검정(LDA, 나이브 베이즈 등)과 고전적 파라미터 검정(Hotelling의 $T^2$ 등)의 검정력을 비교하는 것.
  • 분류 정확도를 이용한 순열 기반 및 가우시안 근사 기반 추론에 대한 이론적 보장을 수립하는 것.
  • 특정 분포 가정 하에 분류기 기반 검정의 최적성과 상대 성능을 평가하기 위해 상대 효율성의 정량적 분석을 수행하는 것.

제안 방법

  • 표본 분할을 통해 오차율을 추정하는 방식으로, 분류 정확도를 두표본 검정의 검정통계량으로 사용하는 일반적 프레임워크를 제안한다.
  • 분류 오차의 귀무분포에 대한 가우시안 근사 기반 검정을 도입하고, 미약한 조건 하에서 점근적 유의수준 제어를 증명한다.
  • 분류 정확도를 위한 순열 검정을 분석하여, 가우시안 근사 방법과 동일한 조건 하에서 일관성을 보임을 보인다.
  • LDA 및 나이브 베이즈 분류기의 고차원 극한($d/n \to c \in (0,\infty)$) 하에서 분류 오차의 점근적 분포를 유도한다.
  • 유한한 첨도를 가진 다변량 정규분포 및 타원형 분포 하에서 LDA 및 나이브 베이즈의 검정력과 후켈링의 $T^2$ 검정을 비교한다.
  • 최소 최대 하한과 점근적 상대 효율성(ARE) 분석을 사용하여 방법의 최적성과 상대 성능을 평가한다.

실험 결과

연구 질문

  • RQ1분류 정확도가 고차원에서 두표본 검정을 위한 일관된 검정통계량이 되는 조건은 무엇인가?
  • RQ2고차원 점근적 설정에서 분류기 기반 검정의 검정력은 후켈링의 $T^2$와 같은 고전적 파라미터 검정과 비교해 어떻게 되는가?
  • RQ3균형 잡힌 가우시안 모델 하에서 LDA 및 나이브 베이즈의 점근적 상대 효율성(ARE)은 후켈링의 $T^2$에 비해 얼마인가?
  • RQ4분류 오차의 귀무분포에 대한 가우시안 근사를 사용하여 타당하고 계산 효율이 높은 검정을 구성할 수 있는가?
  • RQ5표본 분할 비율은 분류 기반 검정의 경험적 검정력에 어떤 영향을 미치는가?

주요 결과

  • 분류기의 진정한 정확도가 $n,d \to \infty$일 때 어떤 고정된 $\epsilon > 0$ 이상으로 우연의 정확도를 초과한다면, 순열 검정과 가우시안 근사 기반 검정 모두 일관성(검정력 $\to 1$)을 가진다.
  • 평균 차이 $\delta$와 공통 공분산 $\Sigma$를 가진 균형 잡힌 가우시안 모델에서, LDA와 후켈링의 $T^2$ 검정의 검정력은 $n,d,\delta,\Sigma$ 측면에서 정확히 일치한다.
  • LDA의 후켈링의 $T^2$에 대한 점근적 상대 효율성(ARE)은 균형 잡힌 표본에서 $1/\sqrt{1.5\pi} \approx 0.43$이지만, 논문은 결과의 정확한 해석에 따라 $1/\sqrt{\pi} \approx 0.58$로 기재한다.
  • 가우시안 근사 기반 검정은 분류기의 미약한 정규성 조건 하에서 점근적 유의수준 제어를 달성한다.
  • 순열 검정은 $n$과 $d$에 따라 충분히 증가하는 순열 수를 가질 경우 동일한 조건 하에서 일관성을 가진다.
  • 시뮬레이션 결과는 경험적 검정력이 표본 분할 비율($\kappa = 0.5$)이 균형을 이루었을 때 최대가 되며, $\kappa$가 극단적이면 정규 근사가 열악해져 유한 표본에서 비대칭이 나타남을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.