Skip to main content
QUICK REVIEW

[논문 리뷰] Classification Logit Two-sample Testing by Neural Networks

Xiuyuan Cheng, Alexander Cloninger|arXiv (Cornell University)|2019. 09. 25.
Model Reduction and Neural Networks참고 문헌 61인용 수 8
한 줄 요약

이 논문은 테스트 세트에서 훈련된 분류기의 로짓 함수 차이를 사용하는 신경망 기반 이중 검정을 제안한다. 하위지수 분포에 대해 이론적으로 일致하는 검정 능력을 증명하며, 데이터가 저차원 다양체 근처에 있을 경우 네트워크 복잡도가 임베딩 차원이 아닌 내재 차원에만 비례함을 보이며, 실험적으로 이전의 신경망 및 커널 기반 방법보다 뛰어난 성능을 보인다.

ABSTRACT

The recent success of generative adversarial networks and variational learning suggests training a classifier network may work well in addressing the classical two-sample problem. Network-based tests have the computational advantage that the algorithm scales to large samples. This paper proposes a two-sample statistic which is the difference of the logit function, provided by a trained classification neural network, evaluated on the testing set split of the two datasets. Theoretically, we prove the testing power to differentiate two sub-exponential densities given that the network is sufficiently parametrized. When the two densities lie on or near to low-dimensional manifolds embedded in possibly high-dimensional space, the needed network complexity is reduced to only scale with the intrinsic dimensionality. Both the approximation and estimation error analysis are based on a new result of near-manifold integral approximation. In experiments, the proposed method demonstrates better performance than previous network-based tests using classification accuracy as the two-sample statistic, and compares favorably to certain kernel maximum mean discrepancy tests on synthetic datasets and hand-written digit datasets.

연구 동기 및 목표

  • 고차원 데이터에서의 확장성과 성능 향상을 위해 딥러닝을 활용해 고전적인 이중 검정 문제를 다루기.
  • 높은 차원 또는 대규모 표본에서 성능이 떨어지는 전통적 커널 기반 검정(예: MMD)의 한계를 극복하기.
  • 훈련된 분류 신경망을 핵심 통계량으로 사용해 이론적으로 탄탄하고 확장 가능한 이중 검정을 개발하기.
  • 분포가 저차원 다각체 근처에 있을 경우 네트워크 복잡도가 임베딩 차원이 아닌 내재 차원에만 의존함을 보여주기.
  • 근접 다각체 적분 근사 기반의 새로운 이론적 프레임워크를 제시해 근사 오차와 추정 오차를 분석하기.

제안 방법

  • 두 분포의 데이터를 병합하여 교차 엔트로피 손실을 사용해 딥 신경망 분류기를 훈련한다(제일자신 분산 최소화와 동치).
  • 테스트 세트에서 두 그룹 간 평균 로짓 값(로그 오즈)의 차이를 검정 통계량으로 계산한다.
  • 근접 다각체 적분 근사 결과를 기반으로 한 새로운 일반화 오차 한계를 사용해 추정 오차를 통제한다.
  • 충분히 넓고 깊은 네트워크가 내재 차원에 따라 스케일링되는 오차로 최적의 로짓 함수를 근사할 수 있음을 보여, 근사 오차 한계를 설정한다.
  • 리프시츠 함수에 대한 농도 불등식과 커버링 추론을 적용해 경험적 기대와 진짜 기대 간의 편차를 극복한다.
  • 로짓 차이 통계량이 i.i.d. 하위지수 랜덤 변수의 합임을 활용해 중심극한정리 기반 분산 통제를 통해 검정 능력을 확보한다.

실험 결과

연구 질문

  • RQ1훈련된 신경망 분류기가 통계적으로 강력하고 확장 가능한 이중 검정 통계량을 제공할 수 있는가?
  • RQ2필요한 네트워크 복잡도가 임베딩 차원에 비례하는가, 아니면 내재 차원에만 비례하는가?
  • RQ3신경망 분류기의 근사 오차가 이중 검정 문제에서 검정 능력에 어떤 영향을 미치는가?
  • RQ4제안된 로짓 기반 검정이 기존의 커널 MMD 및 정확도 기반 신경망 검정보다 뛰어나게 성능을 낼 수 있는가?
  • RQ5하위지수 尾 꼬리 가정 하에 검정의 일관성과 검정 능력에 대해 어떤 이론적 보장을 확보할 수 있는가?

주요 결과

  • 제안된 로짓 기반 검정은 이전의 분류 정확도를 통계량으로 사용하는 신경망 방법보다 더 높은 통계적 검정 능력을 달성한다.
  • 합성 다각체 데이터 및 MNIST 숫자 생성 작업에서 가우시안 커널 MMD보다 성능이 뛰어나며, 특히 고차원 설정에서 두각한다.
  • 이론적 분석 결과, 분포가 저차원 다각체 근처에 있을 경우 네트워크 복잡도가 임베딩 차원이 아닌 내재 차원에만 비례함을 보였다.
  • 추정 오차는 내재 차원과 표본 크기를 포함한 항으로 제한되며, 구체적으로 $ O((\text{log } n / n)^{1/(2+d)}) $ 로 표현되며, 여기서 $ d $ 는 내재 차원이다.
  • 근사 오차는 근접 다각체 적분 근사 결과를 통해 통제되며, 유한한 도약을 가진 다각체 위의 적분 편차를 제한한다.
  • 귀무가설 하에서 검정 통계량은 渐近적으로 정규분포를 띠며, 그 분산은 네트워크의 리프시츠 상수에 따라 결정되는 상수로 제한되어 신뢰할 수 있는 추론을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.