Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized incomplete $U$-statistics in high dimensions

Xiaohui Chen, Kengo Kato|arXiv (Cornell University)|2017. 12. 03.
Statistical Methods and Inference참고 문헌 40인용 수 3
한 줄 요약

이 논문은 높은 차원에서의 U-통계량에 대한 계산적으로 효율적인 추론을 가능하게 하기 위해 희소하고 랜덤화된 가중치를 사용하는 무작위로 불완전한 U-통계량을 제안한다. 이는 표본 크기 $ n $ 과 차원 $ d $ 가 모두 클 때 유용하다. 이 방법은 비점근적 정규 근사 오차 한계를 확보하고, $ d \gg n $ 인 경우에도 탈중립성과 비탈중립성 핵심 함수에 대해 계산적으로 효율적인 부트스트랩 절차를 제공한다.

ABSTRACT

This paper studies inference for the mean vector of a high-dimensional $U$-statistic. In the era of Big Data, the dimension $d$ of the $U$-statistic and the sample size $n$ of the observations tend to be both large, and the computation of the $U$-statistic is prohibitively demanding. Data-dependent inferential procedures such as the empirical bootstrap for $U$-statistics is even more computationally expensive. To overcome such computational bottleneck, incomplete $U$-statistics obtained by sampling fewer terms of the $U$-statistic are attractive alternatives. In this paper, we introduce randomized incomplete $U$-statistics with sparse weights whose computational cost can be made independent of the order of the $U$-statistic. We derive non-asymptotic Gaussian approximation error bounds for the randomized incomplete $U$-statistics in high dimensions, namely in cases where the dimension $d$ is possibly much larger than the sample size $n$, for both non-degenerate and degenerate kernels. In addition, we propose generic bootstrap methods for the incomplete $U$-statistics that are computationally much less-demanding than existing bootstrap methods, and establish finite sample validity of the proposed bootstrap methods. Our methods are illustrated on the application to nonparametric testing for the pairwise independence of a high-dimensional random vector under weaker assumptions than those appearing in the literature.

연구 동기 및 목표

  • 표본 크기 $ n $ 과 차원 $ d $ 가 모두 크고 $ d \gg n $ 이며 $ r \geq 3 $ 인 고차원 환경에서 완전한 U-통계량의 계산 비용이 지나치게 높아지는 문제를 해결하기 위해.
  • 완전한 U-통계량의 경험 부트스트랩은 $ O(Bn^r d) $ 번의 연산이 필요하여 비용이 지나치게 높기 때문에, 이를 대체할 계산적으로 효율적인 방법을 개발하기 위해.
  • 고차원에서 불완전한 U-통계량에 대한 비점근적 정규 근사 오차 한계를 수립하기 위해.
  • 불완전한 U-통계량을 기반으로 하는 일반적인 계산적으로 효율적인 부트스트랩 방법을 제안하고, 유한 표본에서의 타당성을 확보하기 위해.
  • 기존 연구보다 더 약한 모멘트 조건 하에서도 비모수적 쌍별 독립성 검정에 응용 가능한 방법의 유효성을 입증하기 위해.

제안 방법

  • 베르누이 표본 추출과 복원 표본 추출을 이용해 희소 가중치를 구성하는 랜덤화된 불완전한 U-통계량을 도입하여, $ r $ 에 의존하지 않는 계산 비용 절감을 달성한다.
  • 분할 정복 전략과 무작위 표본 추정을 활용해 부트스트랩 분포를 효율적으로 근사한다.
  • 고차원에서 랜덤화된 불완전한 U-통계량에 대한 비점근적 정규 근사 오차 한계를 유도하며, 이는 $ n $, $ d $, $ r $ 에 명시적인 의존성을 포함한다.
  • 불완전한 U-통계량을 기반으로 한 일반적인 부트스트랩 방법(MB-NDG-DC 및 MB-NDG-RS)을 제안하고, 유한 표본 타당성에 대한 이론적 근거를 제공한다.
  • 랜덤 표본 설계를 고려해 조정하는 정규화 체계를 도입하여 분산 제어와 근사 정확도를 향상시킨다.
  • 선형 모델을 활용해 계산 실행 시간을 분석하여, 부트스트랩 방법의 스케일링이 $ O(n^2) $ 로 예측과 일치함을 보였다.

실험 결과

연구 질문

  • RQ1랜덤화된 불완전한 U-통계량은 $ d \gg n $ 인 고차원 환경에서 정확한 정규 근사를 달성할 수 있는가?
  • RQ2고차원에서 랜덤화된 불완전한 U-통계량의 정규 근사에 대한 비점근적 오차 한계는 무엇인가?
  • RQ3불완전한 U-통계량에 대해 계산적으로 효율적인 부트스트랩 절차를 구성할 수 있으며, 이는 유한 표본 타당성을 유지하는가?
  • RQ4제안된 부트스트랩 방법의 계산 비용과 정확도 측면에서 표준 경험 부트스트랩과 비교해 성능가능성은 어떠한가?
  • RQ5이 방법은 기존 방법보다 더 약한 모멘트 조건 하에서도 쌍별 독립성의 비모수적 검정에 적용 가능한가?

주요 결과

  • 랜덤화된 불완전한 U-통계량은 $ n $, $ d $, $ r $ 에 대해 유리하게 스케일링되는 비점근적 정규 근사 오차 한계를 확보하며, $ d \gg n $ 인 고차원 환경에서도 성립한다.
  • 제안된 부트스트랩 방법(MB-NDG-DC 및 MB-NDG-RS)은 계산 비용을 $ O(Bn^r d) $ 에서 $ O(BN d) $ 로 줄였으며, 여기서 $ N \ll n^r $ 이고, 실행 시간은 $ O(n^2) $ 로 이론적 예측과 일치한다.
  • 실험 결과, 모든 테스트 구성에서 부트스트랩 검정의 균일한 크기 오차가 0.02 이하로 유지되어 강력한 유한 표본 타당성을 보였다.
  • 정규 근사는 매우 정확했으며, P-P 플롯은 $ \sqrt{n}U_{n,N}' $ 의 경험 분포와 정규 목표 분포 사이의 근사가 매우 잘 일치함을 보였다.
  • 랜덤 정규화 체계는 결정론적 정규화보다 근사 정규 분포의 분산을 더 작게 만들어 정확도를 향상시켰다.
  • 비모수적 쌍별 독립성 검정에 대해 이전에 요구하던 것보다 더 약한 모멘트 조건 하에서도 성공적으로 적용되었으며, $ a = 0.9 $ 인 코풀라 상관관계 예시에서 이를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.