Skip to main content
QUICK REVIEW

[논문 리뷰] Ordering-Free Inference from Locally Dependent Data

Kyungchul Song|arXiv (Cornell University)|2016. 04. 02.
Statistical Methods and Inference참고 문헌 42인용 수 7
한 줄 요약

이 논문은 웹 크롤링 또는 네트워크 기반 데이터셋과 같은 고차원적이고 국소적으로 종속적인 데이터에서 순서 없는 방법으로 통계적 추론을 위한 랜덤 서브샘플링 기반 추론을 제안한다. 무작위로 추출한 서브샘플에서의 검정 통계량을 집계함으로써, 종속성의 순서를 알 필요 없이 渐近적으로 타당한 결과를 도출할 수 있으며, 시뮬레이션에서 U형 통계량이 M형보다 우수한 성능을 보였다.

ABSTRACT

This paper focuses on a data-rich environment where the data set has a very large cross-sectional dimension, is likely to exhibit local dependence, and yet is hard to determine the dependence ordering. Such a situation arises, for example, when the data set is collected from the Internet, through a method of web crawling. This paper proposes an approach of randomized subsampling inference, where one constructs a test statistic by aggregating many randomized test statistics using random draws of subsamples, and uses for inference the conditional distribution of the test statistic given data. This paper explores two approaches of such inference: one based on an M-type statistic constructed from randomized mean statistics and the other based on a U-type statistic constructed from randomized U-statistics. This paper provides conditions for local dependence, the number of the random draws, and the subsample size, under which randomized subsampling inference is asymptotically valid. From the Monte Carlo simulation studies, this paper finds that the randomized subsampling inference based on the U-type statistics performs better than that based on the M-type statistics.

연구 동기 및 목표

  • 고차원적이고 국소적으로 종속적인 데이터에서 종속성의 순서가 알려져 있지 않은 상황에서도 통계적 추론을 수행하는 것.
  • 교차 단위 간 종속성 구조를 모델링하거나 특정하게 규명할 필요가 없는 방법을 개발하는 것.
  • 웹 크롤링 데이터, 소셜 네트워크 또는 관찰되지 않는 대체 패턴이 존재하는 제품 시장과 같은 실제 응용 분야에 적용 가능한 이론적으로 타당하고 실용적인 추론 절차를 제공하는 것.
  • 국소적 종속성과 순서의 결여로 인해 실패하는 기존의 서브샘플링 및 부트스트랩 방법을 확장하는 것.
  • 랜덤 서브샘플링 기반 추론이 渐近적으로 타당해지는 조건을 규명하고, 평균 검정에 초점을 맞추는 것.

제안 방법

  • 독립적으로 추출한 서브샘플들로부터 여러 개의 무작위 t검정 통계량을 집계하여 검정 통계량을 구성한다.
  • 데이터를 조건으로 한 집계된 검정 통계량의 조건부 분포를 사용하여 임계값을 결정함으로써, 渐近적 정규성에 의존하지 않는다.
  • 두 가지 유형의 통계량을 사용한다: M형은 랜덤화된 평균 통계량에 기반하고, U형은 랜덤화된 U통계량에 기반한다.
  • 서브샘플 크기, 무작위 추출 수, 국소적 종속성 구조에 대한 조건을 부여하여 渐近적 타당성을 확보한다.
  • 순서에 불변인 국소적 종속성 측정법을 사용하여, 종속성의 순서가 알려지지 않거나 식별되지 않는 환경에서도 적용 가능하게 한다.
  • 마팅게일 및 모멘트 기반의 추론을 사용하여 검정 통계량의 조건부 분포가 파라미터에 의존하지 않는 극한 분포로 수렴함을 증명한다.

실험 결과

연구 질문

  • RQ1종속성의 순서가 알려지지 않거나 식별되지 않는 고차원적이고 국소적으로 종속적인 데이터에서 통계적 추론을 수행할 수 있는가?
  • RQ2종속성의 구조를 알지 못해도 국소적 종속성 하에서 랜덤 서브샘플링 기반 추론이 여전히 渐近적으로 타당한가?
  • RQ3유한 표본에서 M형과 U형 랜덤 통계량의 성능 특성은 어떻게 비교되는가?
  • RQ4서브샘플 크기와 무작위 추출 수에 대해 어떤 조건이 추론 절차의 渐近적 타당성을 보장하는가?
  • RQ5정규 근사에 의존하지 않고도 집계된 검정 통계량의 조건부 분포를 사용하여 타당한 임계값을 구성할 수 있는가?

주요 결과

  • 종속성의 국소성, 서브샘플 크기, 무작위 추출 수에 대한 조건 하에서, 종속성의 순서를 알지 못하더라도 랜덤 서브샘플링 기반 추론 방법은 渐近적으로 타당하다.
  • 랜덤화된 U통계량에 기반한 U형 통계량 접근법이 몬테카를로 시뮬레이션에서 M형 접근법보다 뛰어난 성능을 보이며, 더 나은 크기와 검정력 특성을 보였다.
  • 데이터를 조건으로 한 검정 통계량의 조건부 분포가 균일하게 확률적으로 파라미터에 의존하지 않는 극한 분포로 수렴하여, 타당한 임계값 구성이 가능하다.
  • 표준 부트스트랩 및 서브샘플링 방법이 종속성 구조의 잘못된 특정화로 실패하는 국소적 종속성 하에서도 이 방법은 타당성을 유지한다.
  • 웹 크롤링 데이터나 소셜 네트워크와 같이 종속성 구조가 복잡하거나 비형식적인 경우에도 渐近적 타당성이 유지된다.
  • 이론적 결과에 따르면, 유지된 가정 하에서 검정 통계량의 추정 오차와 편향 항목이 渐近적으로 사라진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.